Skip to main content

> ML_LITERATURE // SHOEYBI-2019-MEGATRON-LM-TRAINING-MULTI-BILLION-PARAMETER-LANGUAGE-MODELS_v1.0

Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, Bryan Catanzaro · arXiv preprint (2019)

systems2019industry-standardartifactsAvailable

Temel Katkı (Principal Contribution)

GPU'lar arasında tensör paralel matris çarpımını tanıtarak dikkat başlıklarını ve MLP izdüşümlerini minimum iletişimle böldü.

Operasyonel ve Mühendislik Uygunluğu

task-text-generation için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.

Temel Varsayımlar (Assumptions)

  • Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: