> ML_LITERATURE // SHOEYBI-2019-MEGATRON-LM-TRAINING-MULTI-BILLION-PARAMETER-LANGUAGE-MODELS_v1.0
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, Bryan Catanzaro · arXiv preprint (2019)
systems2019industry-standardartifactsAvailable
Temel Katkı (Principal Contribution)
GPU'lar arasında tensör paralel matris çarpımını tanıtarak dikkat başlıklarını ve MLP izdüşümlerini minimum iletişimle böldü.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
