Kimi K3 用 QAT、RL 和 MOPD 训练多专家模型
nrehiew_ · x · 2026-07-29
这条讲的是 Kimi K3 的训练流水线和任务分布,更偏模型本身。
- 训练流程:先做 SFT,其中用了 QAT,权重是 MXFP4,激活是 MXFP8;之后进入 RL,最后用 MOPD 做整合。
- 多专家模型:他们会为不同 reasoning level 训练多个 expert。
- RL 细节:作者判断算法像是 GRPO 变体,而不是 GLM 5.2 用的 PPO。
- MOPD:用于把不同领域的能力收束到一个统一模型里,但 top-k distillation 没看出明显优势。
- 任务类型:包括 general verifiable、kernel optimization、personal assistant、autoresearch 和 webdev;其中 webdev 明确提到 SVG/3D。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「模型」频道最新
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29
- Verdent 携手月之暗面,为 2.8T 参数 Kimi K3 优化编程工作流 — PrajwalTomar_ · 2026-07-29
- 120B 参数内最强本地模型求推荐:Qwen 系列仍是唯一解? — Possible_Grocery8079 · 2026-07-29
- OpenMed 发布开源医疗 AI 框架,结合 Kimi 本地处理临床数据 — MaziyarPanahi · 2026-07-29
- 教授实测 Flux 3:复杂提示词还原度极高 — emollick · 2026-07-29