Skip to main content

> ML_LITERATURE // DEEPSEEK-2025-DEEPSEEK-R1-INCENTIVIZING-REASONING-VIA-RL_v1.0

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, Xiaokang Chen, Xingkai Yu, Yishi Piao, Z. F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Zicheng Shen, Bing Xue, Bingxuan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, Damai Dai, Erhang Li, Fangyun Lin, Fuli Luo, Guangbo Hao, Guanting Chen, H. Zhang, Hanwei Xu, Hao Yang, Hongxuan Sum, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J. L. Li, Jiashi Li, Jiawei Wang, Jingyang Yuan, Kai Dong, Kaige Gao, Kang Guan, Kexin Huang, Kuai Yu, Lean Wang, Lecong Zhang, Liang Zhao, Litong Wang, Liyue Zhang, Meng Li, Miaojun Wang, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Panpan Huang, R. J. Chen, R. L. Jin, Ruiqi Ge, Ruisong Zhang, Ruixiang Xu, Runyi Hu, S. S. Li, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shaoqing Wu, Shengfeng Ye, Shiyu Wang, Shuang Zhou, Shuiping Yu, Shunfeng Zhou, Suming Wang, Tian Pei, Tianyu Sun, W. L. Xiao, Wangding Zeng, Wanjia Zhao, Wei An, Wen Liu, Wenfeng Liang, Wenjun Gao, Wentao Zhang, X. Q. Li, Xiangyue Deng, Xiaojin Shen, Xiaosha Chen, Xiaotao Nie, Xiaowen Sun, Xiaoxiang Wang, Xin Liu, Xin Xie, Xinnan Song, Xinxia Shan, Xinyi Zhou, Xinyu Yang, Xuan Lu, Xuecheng Su, Y. Wu, Y. K. Li, Yan Ma, Yichao Zhang, Ying He, Yisong Wang, Yixuan Tan, Yiyuan Liu, Yongji Wang, Yu Wu, Yuan Xiao, Yuda Zhao, Yue Wang, Yujiang Li, Yunxian Ma, Yuting Yan, Yuxiang You, Yuxuan Liu, Z. Z. Ren, Zehui Ren, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhigang Yan, Zhipeng Xu, Zhongyu Zhang, Zihui Gu, Zijia Zhu, Zijun Liu, Zilin Li, Ziwei Xie, Ziyang Song, Ziyi Gao, Zizheng Pan · arXiv preprint (2025)

algorithm2025industry-standardthirdPartyReproduced

Principal Contribution

Demonstrated emergence of long-horizon self-verification and chain-of-thought reasoning purely via pure reinforcement learning (DeepSeek-R1-Zero) without supervised fine-tuning.

Operational Relevance

Directly guides architectural decisions, alignment strategy, and serving infrastructure for task-text-generation, task-code-generation.

Assumptions

  • Empirical distribution regularity holds and target domain adheres to pretraining linguistic/visual support

Limitations

  • Resource scaling, inference memory requirements, and alignment robustness vary with model size and hardware topology

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: