多语言对齐预训练
通过创新的课程学习框架实现中文与英文能力协同优化:在预训练阶段采用渐进式语料混合策略(早期中文占比70%,后期平衡至50%),并原创中文语义单元分割算法,解决中英文混合编码冲突问题。核心技术指标包括中文CLUE榜单零样本学习准确率超越GPT-4(85.3% vs 83.1%),同时保持英文MMLU基准同等水平。
稀疏专家模型 (MoE)
DeepSeek的核心预训练架构采用稀疏混合专家模型(Mixture of Experts),其创新点在于动态路由机制:对每个输入token只激活少量专家模块(如10亿参数模型中每个token仅调用1-2个专家),从而显著提升模型容量(最高达千亿级)同时保持训练和推理效率。关键技术突破包括基于负载均衡的专家分配算法,以及专家并行分布式训练框架,实现训练吞吐量相比密集模型提升3倍以上。