> ML_LITERATURE // KAPLAN-2020-SCALING-LAWS-NEURAL-LANGUAGE-MODELS_v1.0
Scaling Laws for Neural Language Models
Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei · arXiv preprint (2020)
foundational2020industry-standardthirdPartyReproduced
Principal Contribution
Empirically demonstrated that language model cross-entropy loss scales as a power-law with model size N, dataset size D, and compute budget C over several orders of magnitude.
Operational Relevance
Directly guides architectural decisions, alignment strategy, and serving infrastructure for task-text-generation.
Assumptions
- Empirical distribution regularity holds and target domain adheres to pretraining linguistic/visual support
Limitations
- Resource scaling, inference memory requirements, and alignment robustness vary with model size and hardware topology
Connected Algorithms, Architectures & Tools
Related Algorithms:
Related Architectures:
Implementing Libraries:
