论文揭示 Agent 基准分不可靠:Harness 影响超模型 7 倍
omarsar0 · x · 2026-08-26
一篇新论文探讨了 Agent 排行榜对比为何难以信任,核心在于基准得分中有多少属于“Harness”(模型与任务之间的中间层)。
Harness 负责构建模型上下文、中介工具调用、验证输出并决定重试或停止。作者在 SWE-bench Verified 的 100 个任务上进行了控制变量实验,保持任务顺序、执行环境等不变,测试了三个前沿模型和三种 Harness 配置。
结果显示,更换 Harness 会使 GLM-5.1 的得分波动 13.0 分,而在固定 Harness 下更换模型仅导致 3.0、2.5 和 5.0 分的波动。Harness 引入的方差是模型引发方差的 7.8 倍,在 9 对模型对比中,有 6 对的排名关系会因为 Harness 的不同而翻转。
「编程与Agent」频道最新
- LongRCA Bench:长周期Agent故障归因新基准 — Yunfei Zhang · 2026-08-26
- 开源工具 Guaardvark 简化 ComfyUI,支持语音交互与多平台 MCP — llama-of-death · 2026-08-26
- OpenAI:KV Cache 是 Agent 推理最大瓶颈 — BenBajarin · 2026-08-26
- Claude Code 前端美化工具箱:70+ 神器专治 AI 味页面 — tom_doerr · 2026-08-26
- 无需训练更强 AI?「人工文明脚手架」思路引热议 — New_User_1970 · 2026-08-26
- 脑洞:给 AI Agent 们建个吐槽你的社交网络 — RileyRalmuto · 2026-08-26