新论文:agent 评测中 harness 影响是模型的 7.8 倍,不披露就别比
rohanpaul_ai · x · 2026-09-01
针对长时程 agent 的一篇新论文《Stop Comparing LLM Agents Without Disclosing the Harness》提出:harness(运行 agent 的脚手架/环境配置)对结果的影响可能大于模型本身,因此 benchmark 分数在不披露或控制 harness 的情况下不可直接比较。
实验设计为 3 个模型 × 3 种 harness,在 100 个 SWE-bench Verified 任务上对比:
- harness 引起的方差平均是模型方差的 7.80 倍。
- 固定模型、从最小 harness 换到完整 harness,pass@1 变化 8.513.0 个百分点;固定 harness、切换模型,只变化 2.55.0 个百分点。
- 排名也不稳定:9 组模型对/harness 对比较中,有 6 组在换 harness 后排名反转。
论文链接:arxiv.org/abs/2605.23950
「编程与Agent」频道最新
- mcp-doctor:静态分析 MCP 服务器,实测揪出 12 个热门仓库真实缺陷 — Wide_Imagination_970 · 2026-09-03
- Akkru 推出金融数据 MCP:让 Agent 用财报数字时保留来源可溯性 — camiggggg · 2026-09-03
- Matt Shumer 解析 Fable 架构:锁定世界结构,各版本共享同一世界 — mattshumer_ · 2026-09-03
- Factory 推 GLM-5.3-Flash:0.06x 费率,在 droid 里全天用不触限额 — matanSF · 2026-09-03
- Qwen 3.8 默认超高推理档遭质疑,不少用户称调低反而更好 — Jorlen · 2026-09-03
- 用 Imagine agent 逐镜生成+网格拼贴,调色实验工作流分享 — Kyrannio · 2026-09-03