FrontierCode 1.1 显示 Opus 5 在更强推理下反而降分
andrew_n_carr · x · 2026-07-25
- 转发帖指出,Opus 5 在 FrontierCode 1.1 上并不总是占优,尤其是在 xhigh 和 max 推理设置下,分数反而更低。
- 帖子里的调查结论是:该基准里的 scope 指标会惩罚 Opus 5 做了与任务无关的修改,从而影响总分。
- 配图是 FrontierCode 1.1 Main 的 score vs cost 对比图,能看到 Opus 5、Fable 5、GPT-5.5/5.6、Kimi K2.7、GLM 5.2 等模型在分数与成本上的位置。
- 这条信息的重点不是单一分数,而是提示:基准结果可能非常依赖 rubric 细节,尤其是对“scope”的定义。
所属事件:Opus 5在FrontierCode测试中中等推理性能最佳(7 条相关)→
「模型」频道最新
- Perplexity 为 Pro 和 Max 用户接入 Opus 5,价格约减半 — AravSrinivas · 2026-07-25
- GPT 5.6 Sol 在某项基准上被标出 72.7% 的更高成绩 — himanshustwts · 2026-07-25
- Anthropic 新模型 Opus 5 曝光:任务耗时与轮次远超 Opus 4.8 — ArtificialAnlys · 2026-07-25
- Claude Opus 5 登顶 AA-Briefcase,单任务成本还降了 20% — ArtificialAnlys · 2026-07-25
- GPT-5.6 Sol 打 Act 3 A7 boss 看起来要赢了 — Jsevillamol · 2026-07-25
- 一张评测图表因数字混乱变成 AI 圈梗图 — Miles_Brundage · 2026-07-25