Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨

Surge AI 团队发布长文复盘对 Kimi K2.7(Max reasoning)的纯强化学习后训练:仅用 1700 个自建编码任务训练,模型在 SWE-Mark 等五个外部编码评测上全面提升。关键发现包括:训练任务与目标评测无关,收益可迁移到未见过的评测;且模型轨迹步数反而下降约三成,说明 RL 提升能力的同时未增加推理冗长度。

2026-09-12 ~ 2026-09-12 · 2 条相关