论文揭示:LLM 排行榜水分大,测试框架是关键
sven_ai · x · 2026-08-26
新论文《Stop Comparing LLM Agents Without Disclosing the Harness》指出,在长周期任务评测中,Agent 执行框架对性能的影响往往超过模型本身。作者通过控制变量实验(3 模型 x 3 Harness x SWE-bench)发现,更换 Harness 带来的方差是模型本身的 7.8 倍,且会导致排名反转。论文提出“约束约束论”,建议评测必须披露 Harness 规范。
所属事件:论文指出Agent排行榜不可信:测试框架影响远超模型本身(2 条相关)→
「研究」频道最新
- 通过版本对比追踪并发现 scikit-learn 的 Bug — Lost-Dragonfruit-663 · 2026-08-26
- Gemini Flash 3.7 联手 GraphJin,实测通过企业级 Agent 安全基准 — dosco · 2026-08-26
- 机器人研究员反思:先问推理行为,再谈模型训练 — deepakpathak · 2026-08-26
- AI 训练应诚实告知模型环境是假的 — Sauers_ · 2026-08-26
- 研究发现LLM推理易受“先验劫持”误导 — RexDouglass · 2026-08-26
- 上交大 SemaPLC:验证闭环让 AI 写 PLC 代码动态行为得分翻 1.7 倍 — 量子位 · 2026-08-26