Kimi K3 论文披露 SFT、RL 和 MOPD 三阶段后训练

stochasticchasm · x · 2026-07-28

Kimi K3 后训练三阶段:SFT、RL、MOPD 合并多种专家策略

帖子展示了论文中的后训练段落。Kimi K3 的后训练管线被写成一个三阶段流程:

配图还补充说,Kimi K3 扩展了用于复杂 agent 任务的 SFT 数据集,数据来自此前的 Kimi 系列模型,并经过多阶段验证和人工在环标注。

所属事件:Kimi K3 技术报告解读:万亿参数与后训练创新(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →