新论文:agent 评测中 harness 影响是模型的 7.8 倍,不披露就别比

rohanpaul_ai · x · 2026-09-01

针对长时程 agent 的一篇新论文《Stop Comparing LLM Agents Without Disclosing the Harness》提出:harness(运行 agent 的脚手架/环境配置)对结果的影响可能大于模型本身,因此 benchmark 分数在不披露或控制 harness 的情况下不可直接比较。

实验设计为 3 个模型 × 3 种 harness,在 100 个 SWE-bench Verified 任务上对比:

论文链接:arxiv.org/abs/2605.23950

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →