Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测

Noam Brown 与研究者 polynoamial 先后公开质疑 CAIS/Scale AI 评测榜单统一以「reasoning high」档位评测所有模型的做法。他们指出,不同模型的 high 推理档含义差异很大,统一口径既导致评测成本不透明,也使模型间成绩不可直接比较,榜单排名的公信力因此受到挑战。

2026-09-24 ~ 2026-09-24 · 2 条相关