Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨
Surge AI 团队发布长文复盘对 Kimi K2.7(Max reasoning)的纯强化学习后训练:仅用 1700 个自建编码任务训练,模型在 SWE-Mark 等五个外部编码评测上全面提升。关键发现包括:训练任务与目标评测无关,收益可迁移到未见过的评测;且模型轨迹步数反而下降约三成,说明 RL 提升能力的同时未增加推理冗长度。
2026-09-12 ~ 2026-09-12 · 2 条相关
- 1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨 — echen · 2026-09-12
- Kimi K2.7 后训练复盘:泛化到未见评测、轨迹步数反降三成 — echen · 2026-09-12