Agent 框架比模型选择更重要:SWE-bench 成绩可相差 10 分
Future_AGI · reddit · 2026-07-22
作者指出,当前 AI Agent 领域的讨论过度聚焦于模型本身(如 GPT 与 Claude 的对比),而忽视了决定 Agent 实际表现的核心要素:模型外围的框架(Harness)。
框架是指将模型转化为 Agent 的包装代码,包括:
- 工具调用与停止时机的循环逻辑
- 工具输出如何回填至上下文
- 上下文窗口溢出时的记忆裁剪策略
- 错误处理与重试机制
核心观点:
- 排行榜成绩是“模型+框架”的综合体现:同一个模型在不同框架下跑分差异巨大。例如在 SWE-bench Pro 测试中,Claude Opus 4.5 在不同标准化框架下得分分别为 46% 和 55%,仅靠改变框架就能带来 10 到 20 分的波动。
- 排查 Agent 不稳定问题应先看框架:当 Agent 表现不稳定时,盲目更换模型往往无效,真正的问题通常出在上下文截断、工具报错未正确回传或重试机制引发的状态污染。优化这些框架层面的细节,比单纯换模型更能提升可靠性。
「编程与Agent」频道最新
- Antithesis 用 exe 让智能体安全操控真实机器 — davidcrawshaw · 2026-07-22
- Every 625 美元年费会员两天带来 9000 美元 MRR — danshipper · 2026-07-22
- 前 DeepMind 等研究员创业,自主智能体在 ARC-AGI 得分跃升至 75.5% — hyperparticle · 2026-07-22
- ChatGPT Work 和 Codex 让原型可直接分享并带登录能力 — gabrielchua · 2026-07-22
- Superwall 推出新 CLI,支持查询 ClickHouse 与审查集成 — JordanMorgan10 · 2026-07-22
- 管理10+终端编码会话:开源工具Fleet发布 — dee_hw · 2026-07-22