> ML_LITERATURE // DUBEY-2024-LLAMA-3-HERD-OF-MODELS_v1.0
The Llama 3 Herd of Models
Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Amy Yang, Angela Fan, Anirudh Goyal, Anthony Hartshorn, Aravind Srinivas, Arno Candel, Binh Tang, Bryan Catanzaro, Chao Zhou, Chloe Bi, Chris Marra, Dan Bikel, David So, Dhruv Mahajan, Eric Michael Smith, Gautier Izacard, Guillaume Lample, Hakan Inan, Iliyan Zarov, Ishita Dasgupta, Jian Xiang Kuan, Joe Spisak, Jon Carvill, Kalyan Saladi, Kevin Stone, Lukas Blecher, Louis Martin, Mark Tygert, Melanie Kambadur, Naman Goyal, Nikhil Kant, Pushkar Mishra, Rashi Rungta, Ross Taylor, Sainbayar Sukhbaatar, Sergey Edunov, Thomas Scialom, Xavier Martinet, Yuning Mao · arXiv preprint (2024)
Temel Katkı (Principal Contribution)
15.6T çok dilli token üzerinde doğal çok modlu destek ve 128K bağlam penceresi ile 405B yoğun parametreye kadar açık temel modeller eğitti.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation, task-code-generation, task-multimodal için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir
