Noam Brown 质疑 CAIS 榜单:统一 reasoning high 评测口径欠妥

polynoamial · x · 2026-09-24

Noam Brown 指出 CAIS 与 Scale AI 评测网站上标注「所有模型均以 reasoning high 评测」的做法存在问题:不同模型的 high 推理档位含义差异很大,统一口径缺乏可比性。

他建议改为报告评测的实际花费成本,或更好——给出准确率 vs 成本的曲线图,而非只标推理档位。

所属事件:Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →