Kimi K2.7 后训练复盘:泛化到未见评测、轨迹步数反降三成

echen · x · 2026-09-12

Surge AI 发布长文复盘对 Kimi K2.7(Max reasoning)的纯 RL 后训练,三组关键发现:

核心结论:K2.7 本来就会写代码,后训练改变的不是知识而是「执行不再脆弱」——从会写变成可交付。团队进一步分析轨迹以找出模型学到的具体新行为。

所属事件:Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →