> ML_LITERATURE // JIANG-2024-MIXTRAL-OF-EXPERTS_v1.0
Mixtral of Experts
Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux, Arthur Mensch, Blanche Savary, Chris Bamford, Devendra Singh Chaplot, Diego de las Casas, Emma Bou Hanna, Florian Bressand, Gianna Lengyel, Guillaume Bour, Guillaume Lample, Lélio Renard Lavaud, Lucile Saulnier, Marie-Anne Lachaux, Pierre Stock, Sandeep Subramanian, Sophia Yang, Szymon Antoniak, Teven Le Scao, Théophile Gervet, Thibaut Lavril, Thomas Wang, Timothée Lacroix, William El Sayed · arXiv preprint (2024)
Temel Katkı (Principal Contribution)
Token başına 8 uzmandan 2'sini yönlendiren (47B toplamdan 13B aktif parametre) 8x7B seyrek uzmanlar karışımı (MoE) mimarisini tanıttı ve Llama 2 70B'yi yakaladı.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation, task-code-generation için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir
