研究者质疑 CAIS 评测用统一 high 推理档:成本不透明且不可比
polynoamial · x · 2026-09-24
研究者 polynoamial 公开质疑 CAIS/Scale AI 评测榜单统一以 "reasoning high" 档位评测所有模型的做法。他指出不同模型在 high 档下的推理投入差异巨大,统一档位并不能保证可比性;建议评测方改为报告评测的实际美元成本,或直接给出准确率 vs 成本的曲线图,比单一分数更有参考价值。
所属事件:Noam Brown 等质疑 CAIS 榜单统一用 high 推理档评测(2 条相关)→
「模型」频道最新
- 用户实感:Claude 额度机制生变,本周主要被 Opus 限额卡住 — rudrank · 2026-09-24
- 用户质疑 OpenAI 用 Sol 换皮 Terra 降价却砍用量额度 — RexDouglass · 2026-09-24
- 生成 demoscene demo 只用掉 Opus 5.5 周额度的不到 3% — gandamu_ml · 2026-09-24
- 研究者发现 Mythos 激活方向与基因组语言模型惊人相似 — jatin_n0 · 2026-09-24
- 物理场景实测:GLM-5.3 牛顿摆完胜隐身新模型 Space Bunny Alpha — rohanpaul_ai · 2026-09-24
- theo 锐评模型格局:Anthropic 缺小模型,OpenAI 缺大模型 — james_mtc · 2026-09-24