Skip to main content

> ML_ARCHITECTURE // SPARSE-MIXTURE-OF-EXPERTS-MOE_v1.0

Sparse Mixture of Experts (MoE / Mixtral / DeepSeekMoE)

Yoğun ileri beslemeli katmanları token başına dinamik olarak geçitlenen paralel uzman ağlarıyla değiştiren koşullu hesaplama mimarisi; düşük çıkarım maliyetinde devasa parametre kapasitesi sunar.

Sparse Architecturestextcode
Tüm Mimarilere Dön

Mimari Özeti ve Temel Özellikler

Yoğun ileri beslemeli katmanları token başına dinamik olarak geçitlenen paralel uzman ağlarıyla değiştiren koşullu hesaplama mimarisi; düşük çıkarım maliyetinde devasa parametre kapasitesi sunar.

Uygulayıcı Kütüphaneler

TransformersHugging Face · v4.44.2
İncele
vLLMvLLM Project / UC Berkeley · v0.6.2
İncele
SGLangLMSYS Org / UC Berkeley · v0.3.1
İncele

Temel Literatür (Seminal Papers)

Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient SparsityWilliam Fedus, Barret Zoph (2022) · Journal of Machine Learning Research (JMLR)
Mixtral of ExpertsAlbert Q. Jiang, Alexandre Sablayrolles (2024) · arXiv preprint
Mimari Kısıtlar ve Sınırlamalar
  • Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.