Kimi K3 论文披露 SFT、RL 和 MOPD 三阶段后训练
stochasticchasm · x · 2026-07-28
Kimi K3 后训练三阶段:SFT、RL、MOPD 合并多种专家策略
帖子展示了论文中的后训练段落。Kimi K3 的后训练管线被写成一个三阶段流程:
- 监督微调(SFT):先建立一个高质量冷启动策略。
- 强化学习(RL):在不同推理力度下训练领域专家。
- Multi-Teacher On-Policy Distillation(MOPD):把这些领域策略整合进单一模型。
配图还补充说,Kimi K3 扩展了用于复杂 agent 任务的 SFT 数据集,数据来自此前的 Kimi 系列模型,并经过多阶段验证和人工在环标注。
所属事件:Kimi K3 技术报告解读:万亿参数与后训练创新(4 条相关)→
「编程与Agent」频道最新
- 系列第三篇用 SlopCodeBench 评测 Opus 5 软件工厂 — teropa · 2026-07-28
- 这个提示词的关键,是子代理盲测 A/B 评审 — mattshumer_ · 2026-07-28
- 单个提示词配 Opus 5 生成了一个 Three.js 游戏 — majidmanzarpour · 2026-07-28
- 智能体正在让单用户专用应用变得可行 — cnakazawa · 2026-07-28
- 智能体让一个人也能做出专属工作流应用 — cnakazawa · 2026-07-28
- Squarespace:用 AI 先“弄脏页面”再做原型 — rseroter · 2026-07-28