研究者质疑 CAIS 评测用统一 high 推理档:成本不透明且不可比

polynoamial · x · 2026-09-24

研究者 polynoamial 公开质疑 CAIS/Scale AI 评测榜单统一以 "reasoning high" 档位评测所有模型的做法。他指出不同模型在 high 档下的推理投入差异巨大,统一档位并不能保证可比性;建议评测方改为报告评测的实际美元成本,或直接给出准确率 vs 成本的曲线图,比单一分数更有参考价值。

所属事件:Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →