FrontierCode 1.1 显示 Opus 5 在 xhigh 和 max 推理档会降分
inductionheads · x · 2026-07-25
FrontierCode 指出 Opus 5 在高推理档会退步
引文里提到,Opus 5 本身是个好模型,整体表现接近 Fable,但价格仍是 Opus 档;不过在更高的推理强度下,它在 FrontierCode 使用的一些指标上会出现回退。
链接中的调查进一步说明,Opus 5 在 FrontierCode 1.1 的 xhigh 和 max 推理设置下分数更低。问题主要出在 benchmark 的 scope 评分:它会惩罚模型做了与任务无关的改动。
因此,这条信息不只是“对不对”的问题,而是提醒:推理越强不一定越符合任务约束,模型在更高推理档下可能反而更容易偏离 benchmark 想要的行为。
所属事件:Opus 5 编码测试反转:推理越强分数反而下滑(13 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11