1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨
echen · x · 2026-09-12
Surge AI 团队仅用强化学习对 Kimi K2.7(Max reasoning)做后训练,在 1700 个自建编码任务上训练后,模型在五个外部编码评测全面提升:SWE-Marathon +20.0、Terminal-Bench 2.1 +14.6、DeepSWE +12.4、Terminal-Bench 3 +10.7、SWE-Bench Pro +4.7。
作者的核心观点:RL 之前 K2.7 像实习生一样会写代码,但「最后一公里」不稳——漏需求、测试写得太窄、引入回归;RL 后像 staff engineer 一样让代码真正可交付。
所属事件:Surge AI 用 1700 个任务 RL 后训练,Kimi K2.7 五项编码评测大涨(2 条相关)→
「编程与Agent」频道最新
- Anthropic 团队用 Claude 值班:告警触发即定位根因并提修复 — ClaudeDevs · 2026-09-12
- 用 Codex 直播 AI 全天玩 Minecraft,目标是自主建自动养鸡场 — nickbaumann_ · 2026-09-12
- 与 AI Agent 共事为何更累:委托不减反增心智负担 — bendee983 · 2026-09-12
- 用户称 Codex 已成 Linux 系统管理主界面:「Codex, 修好它」 — mark_k · 2026-09-12
- Alchemy 推出 distilled 项目:把各大 SaaS 文档蒸馏成统一 SDK 供 Agent 调用 — samgoodwin89 · 2026-09-12
- 关键输入交给 AI 智能体后如何复现研究?EDSL 通用远程缓存给出答案 — soumitrashukla9 · 2026-09-12