1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨

echen · x · 2026-09-12

Surge AI 团队仅用强化学习对 Kimi K2.7(Max reasoning)做后训练,在 1700 个自建编码任务上训练后,模型在五个外部编码评测全面提升:SWE-Marathon +20.0、Terminal-Bench 2.1 +14.6、DeepSWE +12.4、Terminal-Bench 3 +10.7、SWE-Bench Pro +4.7。

作者的核心观点:RL 之前 K2.7 像实习生一样会写代码,但「最后一公里」不稳——漏需求、测试写得太窄、引入回归;RL 后像 staff engineer 一样让代码真正可交付。

所属事件:Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →