OfirPress 质疑新榜单算法:子集挑题+平均通过率,掩盖任务真实完成度

OfirPress · x · 2026-09-23

OfirPress 在回复中解释其榜单与他人报告分数差异的原因:其一,对方只使用了 166 个任务的子集,很可能丢弃了其 200 题全集里 10-20 个最难的题;其二,对方报告的是平均总测试通过率,而他报告的是平均任务完成率(即完全解决的任务数)。他指出模型常常只完成任务的 60-70%,这种部分解会拉高通过率类指标。

所属事件:Ofir Press 解析榜单分数差异:子集挑题与计分口径之弊(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →