FrontierCode 1.1 显示 Opus 5 在 xhigh 和 max 推理档会降分
inductionheads · x · 2026-07-25
FrontierCode 指出 Opus 5 在高推理档会退步
引文里提到,Opus 5 本身是个好模型,整体表现接近 Fable,但价格仍是 Opus 档;不过在更高的推理强度下,它在 FrontierCode 使用的一些指标上会出现回退。
链接中的调查进一步说明,Opus 5 在 FrontierCode 1.1 的 xhigh 和 max 推理设置下分数更低。问题主要出在 benchmark 的 scope 评分:它会惩罚模型做了与任务无关的改动。
因此,这条信息不只是“对不对”的问题,而是提醒:推理越强不一定越符合任务约束,模型在更高推理档下可能反而更容易偏离 benchmark 想要的行为。
所属事件:Opus 5 测试现反直觉现象:中等推理性能最佳(10 条相关)→
「模型」频道最新
- Grok 4.5 在 Augment 里录得最大周增幅 — Daniel_Farinax · 2026-07-25
- 有人能让 AI 以 24fps 看完整段视频吗 — mattshumer_ · 2026-07-25
- Kimi 权重若公开,争论会转向硬件经济学对 V4 — teortaxesTex · 2026-07-25
- Anthropic 详解 Fable 5 编排、advisor 模式与缓存成本 — brada · 2026-07-25
- PaddlePaddle 的 HPD-Parsing 在 Hugging Face 走热,主打文档解析 — PaddlePaddle · 2026-07-25
- Claude Opus 5 在高推理档位达到最佳性价比 — thesaraharminta · 2026-07-25