SWE-bench 实测:换框架比换模型管用,极简才是最强 Agent
OfirPress · x · 2026-08-09
近期 NeurIPS 审稿与 SWE-bench Pro 实测均指出,AI 编程智能体正陷入对复杂框架的过度迷信。
- 框架差异大于模型差异:在 SWE-bench Pro 测试中,仅更换外部框架,就能让 GLM-5.2 的 pass@1 从 23% 飙升至 52%,提升幅度远超常规的模型迭代。
- 能力不迁移:不存在通用的“最强框架”。为大型模型深度优化的框架(如 Codex),换到小模型上排名可能直接垫底,不同模型间的框架排名相关性几乎为零。
- 极简主义胜出:开发者认为,给模型少量核心工具(如纯 Bash 环境)并减少干预,才是当前最强解。如果模型确实需要复杂工具,它完全可以在运行时动态为自己合成(如 live-SWE-agent)。
所属事件:SWE-bench实测表明换Agent框架比换模型更管用(2 条相关)→
「编程与Agent」频道最新
- 给 AI Agent 千美元预算,加密社区自发为其打赏超万美元 — kleffew94 · 2026-08-09
- 让 Agent 自主付 API 账单两个月:自动支付很稳,但坑在别处 — VoidRyanZane · 2026-08-09
- 斯坦福开源 Shepherd:像用 Git 一样回滚 AI 智能体状态 — blaizedsouza · 2026-08-09
- AI 智能体 8 小时将 SQLite 性能提升 59%,百万测试全通过 — rohanpaul_ai · 2026-08-09
- Nous Research 拆解 Hermes 智能体:四大角色配置协同工作 — NousResearch · 2026-08-09
- OpenAI高管断言本地Agent将淘汰,云端重执行成下一代范式 — 机器之心 · 2026-08-09