研究:换 agent 框架影响堪比重跑,精简 harness 提示词可省 3 倍成本
dair_ai · x · 2026-10-08
dair-ai 推荐 paper:同模型不同 agent harness 的系统性研究。
- 核心结论:保持模型不变,仅更换 harness(Claude Code、mini-SWE-agent、OpenCode)就会显著改变结果——其影响幅度与重跑实验相当。在 45 题困难集上,两种 harness 各有 13% 的任务结果翻转;Claude Code 与 mini-SWE-agent 在 SWE-bench Verified 的 447 题上分差不到 5 分。
- 成本来源:system prompt 和工具 schema 在 agent 每一步都被重复发送,步数越多付得越多。
- 实操建议:把 harness 提示词和工具集做小,可降低最多 3 倍成本而不损失准确率。
所属事件:换 agent 框架堪比重跑:harness 对模型表现影响实测(7 条相关)→
「编程与Agent」频道最新
- ChatGPT 控制 Claude 控制 ChatGPT:作者晒出 AI 应用互相调用的套娃现场 — danshipper · 2026-10-08
- 《百页深度学习书》作者考虑再写一本 Python 动手版 Agentic Harness 小书 — burkov · 2026-10-08
- Every 放弃个人 Agent 转做共享公司 Agent,并开放给企业试用 — danshipper · 2026-10-08
- JPMorgan 研究员:AI 编码烂活泛滥,根因是用户对 Agent 太纵容 — JFPuget · 2026-10-08
- Agent 评测实操三步:录全程、人工标注、只用二元 fail 标签 — strickvl · 2026-10-08
- Agent 失败两次就补回归测试:开发者总结编码智能体调试工作流 — strickvl · 2026-10-08