Kimi K2.7 纯 RL 训练逆袭:小模型跑分超 GPT-5.6 与自家 K3
echen · x · 2026-09-17
Surge AI 团队分享仅用强化学习后训练 Kimi K2.7(Max reasoning)的成果:在 1700 个自建编码任务上做 RL 后,模型在五个外部编码基准全部提升。
三个关键发现
- 收益可迁移:提升横跨三种不同的 agent harness,且在训练前尚未存在的评测格式(SWE-Marathon、Terminal-Bench 3)上也出现最大涨幅。
- 小模型超越大模型:后训练后的 K2.7 在 Terminal-Bench 2.1/3 上超过自家更大的 K3,在 SWE-Bench Pro 上略胜 GPT-5.6 Sol(Max reasoning)——作者注明是情境性对比而非受控对比。
- 效率提升:DeepSWE 上中位轨迹长度从 150 步降至 98 步,Terminal-Bench 3 从 102 降至 78。
涌现行为:一次训练中模型需要写 Zstandard 解压器,但没有 zstd 二进制可验证——它先写了一个压缩器,自己生成合法测试文件,再用这些文件测试解压器。没有 ground truth 就自己造一个。
「编程与Agent」频道最新
- OpenClaw 创作者将亮相 Cloudflare Connect 2026 Agent 议题 — steipete · 2026-09-17
- 别指望 LLM 懂 MCP:分清工具调用边界,Agent 调试轻松一半 — gethackteam · 2026-09-17
- YC 系 Extend 发布 Parse Router,按页智能路由解析引擎 — ycombinator · 2026-09-17
- 让 Codex 自己打电话:他用手头旧礼品卡搞定购票 — brandon_galang · 2026-09-17
- Alchemy IaC 工具发布面向 Coding Agent 的官方提示词 — samgoodwin89 · 2026-09-17
- LangChain 创始人做客 Navigators 播客,谈 Agent 构建方法论 — LangChain · 2026-09-17