FrontierCode 1.1 显示 Opus 5 在 xhigh 和 max 推理档会降分

inductionheads · x · 2026-07-25

FrontierCode 指出 Opus 5 在高推理档会退步

引文里提到,Opus 5 本身是个好模型,整体表现接近 Fable,但价格仍是 Opus 档;不过在更高的推理强度下,它在 FrontierCode 使用的一些指标上会出现回退。

链接中的调查进一步说明,Opus 5 在 FrontierCode 1.1 的 xhigh 和 max 推理设置下分数更低。问题主要出在 benchmark 的 scope 评分:它会惩罚模型做了与任务无关的改动。

因此,这条信息不只是“对不对”的问题,而是提醒:推理越强不一定越符合任务约束,模型在更高推理档下可能反而更容易偏离 benchmark 想要的行为。

所属事件:Opus 5 测试现反直觉现象:中等推理性能最佳(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →