Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测
Noam Brown 与研究者 polynoamial 先后公开质疑 CAIS/Scale AI 评测榜单统一以「reasoning high」档位评测所有模型的做法。他们指出,不同模型的 high 推理档含义差异很大,统一口径既导致评测成本不透明,也使模型间成绩不可直接比较,榜单排名的公信力因此受到挑战。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 研究者质疑 CAIS 评测用统一 high 推理档:成本不透明且不可比 — polynoamial · 2026-09-24
- Noam Brown 质疑 CAIS 榜单:统一 reasoning high 评测口径欠妥 — polynoamial · 2026-09-24