> ML_ARCHITECTURE // SPARSE-MIXTURE-OF-EXPERTS-MOE_v1.0
Sparse Mixture of Experts (MoE / Mixtral / DeepSeekMoE)
Yoğun ileri beslemeli katmanları token başına dinamik olarak geçitlenen paralel uzman ağlarıyla değiştiren koşullu hesaplama mimarisi; düşük çıkarım maliyetinde devasa parametre kapasitesi sunar.
Sparse Architecturestextcode
Tüm Mimarilere DönMimari Özeti ve Temel Özellikler
Yoğun ileri beslemeli katmanları token başına dinamik olarak geçitlenen paralel uzman ağlarıyla değiştiren koşullu hesaplama mimarisi; düşük çıkarım maliyetinde devasa parametre kapasitesi sunar.
Uygulayıcı Kütüphaneler
Temel Literatür (Seminal Papers)
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient SparsityWilliam Fedus, Barret Zoph (2022) · Journal of Machine Learning Research (JMLR)
Mixtral of ExpertsAlbert Q. Jiang, Alexandre Sablayrolles (2024) · arXiv preprint
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language ModelDeepSeek-AI, Aixin Liu (2024) · arXiv preprint
Mimari Kısıtlar ve Sınırlamalar
- Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.
