Kimi K3 报告披露 2.8T MoE 后训练配方

cwolferesearch · x · 2026-07-29

这条转发梳理了 Kimi K3 的后训练配方。K3 是一个 2.8T 参数的开权重 MoE 模型,激活参数 104B。报告里的训练流程大致分三步:

作者认为,这种“先用 RL 训窄专家,再用蒸馏整合”正在成为前沿模型后训练的标准套路;报告里也没有单独的 RLHF 或 DPO 阶段。文中还提到,K3 相比 Kimi K2 的总体 scaling 效率约提升 2.5 倍,在长上下文、编程、推理和智能体任务上都有很强表现。

所属事件:Kimi K3 架构深度解析:2.8T参数与注意力机制革新(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →