> ML_LITERATURE // DEEPSEEK-2024-DEEPSEEK-V2-ECONOMICAL-MOE_v1.0
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-AI, Aixin Liu, Bei Feng, Bing Xue, Bingxuan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, Damai Dai, Daya Guo, Dejian Yang, Erhang Li, Fangyun Lin, Fuli Luo, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Hongxuan Sum, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J. L. Li, Jiashi Li, Jiawei Wang, Jingyang Yuan, Junxiao Song, Kai Dong, Kaige Gao, Kang Guan, Kexin Huang, Kuai Yu, Lean Wang, Lecong Zhang, Liang Zhao, Litong Wang, Liyue Zhang, Meng Li, Miaojun Wang, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Panpan Huang, Peiyi Wang, R. J. Chen, R. L. Jin, Ruiqi Ge, Ruisong Zhang, Ruixiang Xu, Runxin Xu, Runyi Hu, S. S. Li, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shaoqing Wu, Shengfeng Ye, Shirong Ma, Shiyu Wang, Shuang Zhou, Shuiping Yu, Shunfeng Zhou, Suming Wang, Tian Pei, Tianyu Sun, W. L. Xiao, Wangding Zeng, Wanjia Zhao, Wei An, Wen Liu, Wenfeng Liang, Wenjun Gao, Wentao Zhang, X. Q. Li, Xiangyue Deng, Xiaojin Shen, Xiaokang Chen, Xiaosha Chen, Xiaotao Nie, Xiaowen Sun, Xiaoxiang Wang, Xin Liu, Xin Xie, Xingkai Yu, Xinnan Song, Xinxia Shan, Xinyi Zhou, Xinyu Yang, Xuan Lu, Xuecheng Su, Y. Wu, Y. K. Li, Yan Ma, Yichao Zhang, Ying He, Yishi Piao, Yisong Wang, Yixuan Tan, Yiyuan Liu, Yongji Wang, Yu Wu, Yuan Xiao, Yuda Zhao, Yue Wang, Yujiang Li, Yunxian Ma, Yuting Yan, Yuxiang You, Yuxuan Liu, Z. Z. Ren, Zehui Ren, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhibin Gou, Zhigang Yan, Zhihong Shao, Zhipeng Xu, Zhongyu Zhang, Zhuoshu Li, Zihui Gu, Zijia Zhu, Zijun Liu, Zilin Li, Ziwei Xie, Ziyang Song, Ziyi Gao, Zizheng Pan · arXiv preprint (2024)
Principal Contribution
Introduced Multi-head Latent Attention (MLA) compressing KV cache by 93% and DeepSeekMoE architecture activating 21B out of 236B parameters.
Operational Relevance
Directly guides architectural decisions, alignment strategy, and serving infrastructure for task-text-generation, task-code-generation.
Assumptions
- Empirical distribution regularity holds and target domain adheres to pretraining linguistic/visual support
Limitations
- Resource scaling, inference memory requirements, and alignment robustness vary with model size and hardware topology
