OfirPress 质疑新榜单算法:子集挑题+平均通过率,掩盖任务真实完成度
OfirPress · x · 2026-09-23
OfirPress 在回复中解释其榜单与他人报告分数差异的原因:其一,对方只使用了 166 个任务的子集,很可能丢弃了其 200 题全集里 10-20 个最难的题;其二,对方报告的是平均总测试通过率,而他报告的是平均任务完成率(即完全解决的任务数)。他指出模型常常只完成任务的 60-70%,这种部分解会拉高通过率类指标。
所属事件:Ofir Press 解析榜单分数差异:子集挑题与计分口径之弊(2 条相关)→
「模型」频道最新
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- steipete 调侃 Anthropic harness 封禁:只封流行的那些 — steipete · 2026-09-23
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 同一像素动画编程题横评:仅一个模型全程无干预跑通 — hullabaloo22 · 2026-09-23
- 用户实测称 Opus 5.5 用起来相当顺手 — Rasmic · 2026-09-23
- 工程师直言 Opus 5 留下阴影,称再也无法直视 Opus 模型 — josh_wills · 2026-09-23