SWE-bench实测:换Agent框架比换模型更能提升编码得分
_lewtun · x · 2026-08-07
开发者针对 10 种主流编码 Agent 框架(如 Codex、Claude Code 等)在 SWE-bench Pro 上进行了跨模型实测。结果发现,框架的选择对最终得分的影响极其显著,甚至超过了模型版本更迭带来的提升。
- 分数跨度极大:以 GLM-5.2 模型为例,更换框架能让 pass@1 从 23% 飙升至 52%;在 Gemma 4 26B-A4B 上也从 15% 提升至 36%。
- 排名不具普适性:框架的表现高度依赖底层模型。模型厂商自带的框架(如 Codex、Claude Code)在自家或大模型上表现好,但换用小模型时排名会大幅下滑;而模型无关的通用框架(如 crush、opencode)则在小型模型上排名跃升。两者间的排名相关性仅为 -0.05。
这表明当前 AI 编码领域过度聚焦于调优模型权重,而忽视了外围工程框架的巨大干预空间。
所属事件:SWE-bench实测表明换Agent框架比换模型更管用(2 条相关)→
「编程与Agent」频道最新
- Vercel 推出 Passport:为 AI 智能体提供企业级身份验证 — brandon_galang · 2026-08-09
- 开源轻量级图像生成工具 Mold:告别繁杂工作流 — brinkjames · 2026-08-09
- 防 AI 白嫖指南:用机器学习模型揪出免费试用滥用 — cneuralnetwork · 2026-08-09
- 亚马逊单任务烧掉180万美元,大厂AI用量失控引发预算紧缩 — 量子位 · 2026-08-09
- 开源 Agent Skill:一键将故事文案转为手绘风动画 — aigclink · 2026-08-09
- ComfyUI 适配 MiniMax H3 潜空间放大节点 — Herooftermina1998 · 2026-08-09