论文指出Agent排行榜不可信:测试框架影响远超模型本身

新论文《Stop Comparing LLM Agents Without Disclosing the Harness》指出,当前 Agent 排行榜的对比结果难以令人信任。核心问题在于模型与任务之间的中间层 Harness:它负责构建模型上下文、中介工具调用,其执行框架对性能的影响可超过模型本身的 7 倍。研究认为,在长周期任务评测中若不披露测试框架细节,排行榜分数就存在大量水分。

2026-08-26 ~ 2026-08-26 · 2 条相关