论文揭示:LLM 排行榜水分大,测试框架是关键

sven_ai · x · 2026-08-26

新论文《Stop Comparing LLM Agents Without Disclosing the Harness》指出,在长周期任务评测中,Agent 执行框架对性能的影响往往超过模型本身。作者通过控制变量实验(3 模型 x 3 Harness x SWE-bench)发现,更换 Harness 带来的方差是模型本身的 7.8 倍,且会导致排名反转。论文提出“约束约束论”,建议评测必须披露 Harness 规范。

所属事件:论文指出Agent排行榜不可信:测试框架影响远超模型本身(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →