Ofir Press 解释第三方跑分更高:任务子集与计分口径不同
OfirPress · x · 2026-09-23
有人询问 Ofir Press 为何第三方报告的分数远高于其官方排行榜,Press 给出两点解释:
- 第三方只用了 200 个任务中的 166 个子集,很可能丢掉了原集合中约 10-20 个超难任务;
- 计分口径不同:第三方报告的是平均总测试通过率,而官方排行榜报告的是平均任务完成率(即完全 100% 解决的任务数)。
这一说明对解读各家 agent 基准分数的可比性很有价值:子集选择和指标定义都会显著抬高表面分数。
所属事件:Ofir Press 解析榜单分数差异:子集挑题与计分口径之弊(2 条相关)→
「模型」频道最新
- GPT-6 实测 LIBERO 机械臂任务:能开灶台,抓不住摩卡壶 — YuXiang_IRVL · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- 算账:Claude Opus 5.5 每任务 $5.98,降价抵消 token 消耗暴涨 — ArtificialAnlys · 2026-09-23
- Claude Opus 5.5 五档模型横评:智力 58 分,各档任务成本差 11 倍 — ArtificialAnlys · 2026-09-23
- GPT-6 强化 prompt caching:命中率提升、诊断面板,缓存省最多 90% — rohanpaul_ai · 2026-09-23
- steipete 调侃 Anthropic harness 封禁:只封流行的那些 — steipete · 2026-09-23