Opus 5 与 5.5 跑分差异之谜:思考档位不同,Frontiercode 惩罚多余改动
andrew_n_carr · x · 2026-09-23
有人质疑 Opus 5.5 与 Opus 5 的 Frontiercode 成绩图表对不上,Andrew Carr 给出解释:两次测量的条件并不相同。
- Opus 5.5 的成绩图用的是 adaptive thinking + Max 档位,而 Opus 5 的发布图用的是 medium thinking。
- Opus 5 在 max 档得分 48,medium 档反而得 53。
- 差异原因:Frontiercode 会惩罚模型做了任务范围外的多余编辑,档位设置直接影响得分。
也就是说,两份图表并非矛盾,而是测试口径不同导致的数字错位。
所属事件:Opus 5 的 FrontierCode 得分从 53.4% 缩水至 48% 引争议(3 条相关)→
「模型」频道最新
- NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI · 2026-09-23
- 开发者吐槽 Anthropic 新安全检查:Opus 5.5 连代码审查都误拦 — evilsocket · 2026-09-23
- 深度对话中的最新模型满是术语跳跃:「更像在跟 AI 交谈而非人类」 — erikphoel · 2026-09-23
- Andrew Carr:Opus 5.5 可能是首个有点「创造力」的模型 — andrew_n_carr · 2026-09-23
- Anthropic 推出生命科学验证计划 LSVP,Opus 5.5 生物任务需审核准入 — _sholtodouglas · 2026-09-23
- 传 OpenAI 将推 GPT-6 Astra Minor,或为 Opus 5.5 对手 — daniel_mac8 · 2026-09-23