Skip to main content

> ML_LITERATURE // KAPLAN-2020-SCALING-LAWS-NEURAL-LANGUAGE-MODELS_v1.0

Scaling Laws for Neural Language Models

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei · arXiv preprint (2020)

foundational2020industry-standardthirdPartyReproduced

Principal Contribution

Empirically demonstrated that language model cross-entropy loss scales as a power-law with model size N, dataset size D, and compute budget C over several orders of magnitude.

Operational Relevance

Directly guides architectural decisions, alignment strategy, and serving infrastructure for task-text-generation.

Assumptions

  • Empirical distribution regularity holds and target domain adheres to pretraining linguistic/visual support

Limitations

  • Resource scaling, inference memory requirements, and alignment robustness vary with model size and hardware topology

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: