Skip to main content

> ML_LITERATURE // DUBEY-2024-LLAMA-3-HERD-OF-MODELS_v1.0

The Llama 3 Herd of Models

Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Amy Yang, Angela Fan, Anirudh Goyal, Anthony Hartshorn, Aravind Srinivas, Arno Candel, Binh Tang, Bryan Catanzaro, Chao Zhou, Chloe Bi, Chris Marra, Dan Bikel, David So, Dhruv Mahajan, Eric Michael Smith, Gautier Izacard, Guillaume Lample, Hakan Inan, Iliyan Zarov, Ishita Dasgupta, Jian Xiang Kuan, Joe Spisak, Jon Carvill, Kalyan Saladi, Kevin Stone, Lukas Blecher, Louis Martin, Mark Tygert, Melanie Kambadur, Naman Goyal, Nikhil Kant, Pushkar Mishra, Rashi Rungta, Ross Taylor, Sainbayar Sukhbaatar, Sergey Edunov, Thomas Scialom, Xavier Martinet, Yuning Mao · arXiv preprint (2024)

seminal-architecture2024industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

15.6T çok dilli token üzerinde doğal çok modlu destek ve 128K bağlam penceresi ile 405B yoğun parametreye kadar açık temel modeller eğitti.

Operasyonel ve Mühendislik Uygunluğu

task-text-generation, task-code-generation, task-multimodal için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.

Temel Varsayımlar (Assumptions)

  • Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: