Noam Brown 质疑 CAIS 榜单:统一 reasoning high 评测口径欠妥
polynoamial · x · 2026-09-24
Noam Brown 指出 CAIS 与 Scale AI 评测网站上标注「所有模型均以 reasoning high 评测」的做法存在问题:不同模型的 high 推理档位含义差异很大,统一口径缺乏可比性。
他建议改为报告评测的实际花费成本,或更好——给出准确率 vs 成本的曲线图,而非只标推理档位。
所属事件:Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测(2 条相关)→
「模型」频道最新
- Meta 首席 AI 官 Alexandr Wang 预告:史上最强模型即将发布 — scaling01 · 2026-09-24
- Meta Connect 现场爆料:Muse Mac 应用将支持 Computer Use — kimmonismus · 2026-09-24
- 传 Anthropic 发布 Claude Opus 5.5:对标竞品性能,典型成本直降 40% — rohanpaul_ai · 2026-09-24
- 受够了模型过度拒绝:用户转用无审查开源模型干活 — Khaledthe · 2026-09-24
- Jev 40 秒拆解 37 个品牌 724 条广告,仅花 0.09 美元 token — sibraan_ · 2026-09-24
- 网友连聊 Opus 5.5 一小时后感叹:「这个行业完蛋了」 — TAbrodi · 2026-09-24