> ML_LITERATURE // HOFFMANN-2022-TRAINING-COMPUTE-OPTIMAL-LARGE-LANGUAGE-MODELS_v1.0
Training Compute-Optimal Large Language Models (Chinchilla)
Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, Tom Hennigan, Eric Noland, Katie Millican, George van den Driessche, Bogdan Damoc, Aurelia Guy, Simon Osindero, Karen Simonyan, Erich Elsen, Jack W. Rae, Oriol Vinyals, Laurent Sifre · Advances in Neural Information Processing Systems (NeurIPS) (2022)
Temel Katkı (Principal Contribution)
Kaplan ölçekleme yasalarını revize ederek parametre sayısı ile eğitim belirteçlerinin eşit oranlarda ölçeklenmesi gerektiğini gösterdi.
Operasyonel ve Mühendislik Uygunluğu
Tüm öncü yapay zeka araştırma topluluğunu şişirilmiş parametre sayılarından belirteç açısından zengin eğitime doğru yeniden yönlendirdi.
Temel Varsayımlar (Assumptions)
- Güç yasası kayıp parametrik ölçekleme fonksiyonları optimal kaynak tahsisi altında çapraz entropi kaybı sınırını doğru modeller
Kısıtlar ve Sınırlamalar (Limitations)
- Yalnızca ön eğitim hesaplama bütçesi optimalitesine odaklanır; daha küçük modelleri fazla eğitmenin çok daha üstün olduğu çıkarım ekonomisini göz ardı eder
