Kimi K2.7 后训练复盘:泛化到未见评测、轨迹步数反降三成
echen · x · 2026-09-12
Surge AI 发布长文复盘对 Kimi K2.7(Max reasoning)的纯 RL 后训练,三组关键发现:
- 收益可迁移:训练任务与目标评测无关——DeepSWE、SWE-Marathon、Terminal-Bench 3 在任务收集时还不存在;提升在三个不同 agent harness(工具、提示、循环结构各异)上都成立。SWE-Marathon 要求多小时长轨迹构建完整系统,TB3 覆盖硬件、科学计算、系统、安全等。
- 小模型反超大模型:按 K3 自报分数,后训练后的 K2.7 在 Terminal-Bench 2.1 与 3 上超过 K3;SWE-Bench Pro 略超 GPT-5.6 Sol(作者注明非受控对比)。
- 效率反升:中位轨迹长度 DeepSWE 从 150 步降至 98 步,TB3 从 102 降至 78。
核心结论:K2.7 本来就会写代码,后训练改变的不是知识而是「执行不再脆弱」——从会写变成可交付。团队进一步分析轨迹以找出模型学到的具体新行为。
所属事件:Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨(2 条相关)→
「编程与Agent」频道最新
- Anthropic 团队用 Claude 值班:告警触发即定位根因并提修复 — ClaudeDevs · 2026-09-12
- 用 Codex 直播 AI 全天玩 Minecraft,目标是自主建自动养鸡场 — nickbaumann_ · 2026-09-12
- 与 AI Agent 共事为何更累:委托不减反增心智负担 — bendee983 · 2026-09-12
- 用户称 Codex 已成 Linux 系统管理主界面:「Codex, 修好它」 — mark_k · 2026-09-12
- Alchemy 推出 distilled 项目:把各大 SaaS 文档蒸馏成统一 SDK 供 Agent 调用 — samgoodwin89 · 2026-09-12
- 1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨 — echen · 2026-09-12