论文指出Agent排行榜不可信:测试框架影响远超模型本身
新论文《Stop Comparing LLM Agents Without Disclosing the Harness》指出,当前 Agent 排行榜的对比结果难以令人信任。核心问题在于模型与任务之间的中间层 Harness:它负责构建模型上下文、中介工具调用,其执行框架对性能的影响可超过模型本身的 7 倍。研究认为,在长周期任务评测中若不披露测试框架细节,排行榜分数就存在大量水分。
2026-08-26 ~ 2026-08-26 · 2 条相关
- 论文揭示 Agent 基准分不可靠:Harness 影响超模型 7 倍 — omarsar0 · 2026-08-26
- 论文揭示:LLM 排行榜水分大,测试框架是关键 — sven_ai · 2026-08-26