> ML_LITERATURE // RAJBHANDARI-2020-ZERO-MEMORY-OPTIMIZATIONS-TOWARD-TRAINING-TRILLION-PARAMETER-MODELS_v1.0
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models
Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, Yuxiong He · IEEE/ACM International Conference on High Performance Computing (SC20) (2020)
systems2020industry-standardartifactsAvailable
Principal Contribution
Introduced the Zero Redundancy Optimizer (ZeRO Stages 1-3), partitioning optimizer states, gradients, and model parameters across data-parallel ranks.
Operational Relevance
Directly guides deployment choices and architecture selection for task-text-generation.
Assumptions
- Standard empirical regularity and statistical stability hold across evaluation domains
Limitations
- Performance characteristics depend on domain distribution and compute allocation parameters
Connected Algorithms, Architectures & Tools
Related Algorithms:
Related Architectures:
Implementing Libraries:
