Kimi K3 报告披露 2.8T MoE 后训练配方
cwolferesearch · x · 2026-07-29
这条转发梳理了 Kimi K3 的后训练配方。K3 是一个 2.8T 参数的开权重 MoE 模型,激活参数 104B。报告里的训练流程大致分三步:
- SFT cold start:用合成的 agent 轨迹做冷启动,再结合多轮验证和人工标注;
- 按领域做 RL:分别针对通用任务、通用智能体、编程智能体等方向训练多个专家,并区分 low / high / max 不同 effort;
- 多教师 on-policy 蒸馏:把 9 个冻结专家蒸馏回一个统一模型。
作者认为,这种“先用 RL 训窄专家,再用蒸馏整合”正在成为前沿模型后训练的标准套路;报告里也没有单独的 RLHF 或 DPO 阶段。文中还提到,K3 相比 Kimi K2 的总体 scaling 效率约提升 2.5 倍,在长上下文、编程、推理和智能体任务上都有很强表现。
所属事件:Kimi K3 架构深度解析:2.8T参数与注意力机制革新(16 条相关)→
「模型」频道最新
- 老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 · 2026-07-29
- 用户称 Gemini Pro 付费后仍被分流到其他模型 — IAmMonke2 · 2026-07-29
- Reddit 争论 Hugging Face/OpenAI “AI hack” 是否可信 — callme_e · 2026-07-29
- 一组假 Claude 截图把“模型福利”写成了 AI 圈名场面 — repligate · 2026-07-29
- ChatGPT 安卓版疑似把模型切换改成 effort 等级 — justanothergin · 2026-07-29
- 伪造 Claude 截图变成超立方体纠错梗图 — repligate · 2026-07-29