Agent 框架比模型选择更重要:SWE-bench 成绩可相差 10 分
Future_AGI · reddit · 2026-07-22
作者指出,当前 AI Agent 领域的讨论过度聚焦于模型本身(如 GPT 与 Claude 的对比),而忽视了决定 Agent 实际表现的核心要素:模型外围的框架(Harness)。
框架是指将模型转化为 Agent 的包装代码,包括:
- 工具调用与停止时机的循环逻辑
- 工具输出如何回填至上下文
- 上下文窗口溢出时的记忆裁剪策略
- 错误处理与重试机制
核心观点:
- 排行榜成绩是“模型+框架”的综合体现:同一个模型在不同框架下跑分差异巨大。例如在 SWE-bench Pro 测试中,Claude Opus 4.5 在不同标准化框架下得分分别为 46% 和 55%,仅靠改变框架就能带来 10 到 20 分的波动。
- 排查 Agent 不稳定问题应先看框架:当 Agent 表现不稳定时,盲目更换模型往往无效,真正的问题通常出在上下文截断、工具报错未正确回传或重试机制引发的状态污染。优化这些框架层面的细节,比单纯换模型更能提升可靠性。
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11