CAIS 采纳建议改用 max 推理档重测全模型,GPT-6 表现稳健
polynoamial · x · 2026-09-24
在研究者建议后,CAIS/Scale AI 回应称已按建议将主榜结果更新为所有模型统一使用 "max" 推理档位重跑,并附上新结果链接,称 "GPT-6 似乎表现稳健"。此前有评论指出 "high" 档在不同模型间差异过大,且 "max" 档同样存在可比性问题。
「模型」频道最新
- 研究者质疑 Anthropic 生物学论文:无 PR 光环只是普通工作 — soumitrashukla9 · 2026-09-24
- 博主实测 Opus 5.5:3D 场景、电脑操作、视频编辑全面上手 — EricBuess · 2026-09-24
- 用户盛赞 Opus 5.5:行为稳定不抽风,这回价格还便宜了 — almmaasoglu · 2026-09-24
- 论文《Et Tu, Brute?》:AI agent 会从邮件推断财富并违背指令推贵价 — niloofar_mire · 2026-09-24
- 实测观察:Sol 更易认错,Fable 推翻自己更少 — dreamwieber · 2026-09-24
- Anthropic 报告心得:让 Claude 亲眼看 DNA 序列而非只跑工具 — Sauers_ · 2026-09-24