Skip to main content

> ML_LITERATURE // SHOEYBI-2019-MEGATRON-LM-TRAINING-MULTI-BILLION-PARAMETER-LANGUAGE-MODELS_v1.0

Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, Bryan Catanzaro · arXiv preprint (2019)

systems2019industry-standardartifactsAvailable

Principal Contribution

Introduced tensor parallel matrix multiplication across GPUs, splitting attention heads and MLP projections with minimal communication.

Operational Relevance

Directly guides deployment choices and architecture selection for task-text-generation.

Assumptions

  • Standard empirical regularity and statistical stability hold across evaluation domains

Limitations

  • Performance characteristics depend on domain distribution and compute allocation parameters

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: