Opus 5 编码测试反转:推理越强分数反而下滑
Claude Opus 5 在 FrontierCode 1.1 基准测试中暴露出反直觉的现象:提升推理强度(至 xhigh 或 max 档位)反而导致编码分数下滑,中等思考模式表现最佳。这一结论为开发者选择模型与配置提供了实用的参考依据。
已确认
在 FrontierCode 1.1 测试中,Opus 5 在中等推理档的表现优于 xhigh 和 max 档。据 @inductionheads 和 @keunwoochoi 转述的系统卡数据,大约 20-30% 的报告基准出现了 max thinking 分数不如 xhigh 的情况。@silasalberti 和 @hero88645 指出,降分的核心原因在于 FrontierCode 评估的不仅是正确率,还包含代码的 merge-ability(可合并性)。其 scope 指标会惩罚 Opus 5 在高推理状态下产生的过度修改或不合规的代码范围扩张。此外,@thesaraharminta 补充了 Vibe Code Bench 的数据,指出 Opus 5 的准确率从 low(76.7%)、medium(82.0%)一路升至 high(88.0%),证明在常规代码生成中高推理档位仍有优势,且高推理档位达到了最佳性价比。
尚未确认
@draginol 提出一种推测,Opus 5 在高 effort 下成绩不佳,可能并非主模型能力衰退,而是因为该模式下更多依赖非 Opus 5 的子代理分担任务,从而拉低了整体评测分数。这一机制仍需更多内部细节证实。
为什么重要
这一发现打破了“思考越多、性能越强”的常规认知。@seh0872 和 @brandongalang 认为,这证明中等推理档位的 Opus 5 是最适合日常默认使用的状态,不仅规避了“想太多”导致的代码越界问题,还能有效控制 Opus 档位的高昂价格成本,为 AI 编程工作流提供了更具性价比的配置方案。
2026-07-24 ~ 2026-07-25 · 13 条相关
- 第 1 集:Opus 5 编码测试反转:推理越强分数反而下滑(2026-07-24,13 条)
- 第 2 集:Claude Opus 5被曝概率推理过程反复摇摆(2026-07-25,3 条)
- 第 3 集:Bug实测:GPT-5.6修复22个bug领先Claude Opus 5(2026-07-25,3 条)
一手来源
- Opus 5 编程分数在 high 以上反而下滑 — hero88645 ·
- Anthropic effort 档位与基准数据,给模型选择提供实用参考 — seh0872 ·
- FrontierCode 显示 Claude Opus 5 在中等推理档最适合默认使用 — brandon_galang ·
- 【源头】Anthropic effort 档位与基准数据,给模型选择提供实用参考 — seh0872 · 2026-07-24
- 【源头】FrontierCode 显示 Claude Opus 5 在中等推理档最适合默认使用 — brandon_galang · 2026-07-25
- 图表显示 Opus 5 在中等思考模式下编码性能最佳 — dejavucoder · 2026-07-25
- FrontierCode 图表显示 Claude Opus 5 中等推理最好 — zainhas · 2026-07-25
- FrontierCode 1.1 显示 Opus 5 在 xhigh 和 max 推理档会降分 — inductionheads · 2026-07-25
- FrontierCode 1.1 显示 Opus 5 在更强推理下反而降分 — andrew_n_carr · 2026-07-25
- Opus 5 max thinking 在两三成基准上反而不如 xhigh — keunwoochoi · 2026-07-25
- FrontierCode 设计解释了 Opus 5 推理越强分数越低 — silasalberti · 2026-07-25
- Opus 5 在 FrontierCode 上中等 effort 反超更高 effort — kieranklaassen · 2026-07-25
- Claude Opus 5 可能因子代理分工而拉低硬测成绩 — draginol · 2026-07-25
- Claude Opus 5 在高推理档位达到最佳性价比 — thesaraharminta · 2026-07-25
- 【源头】Opus 5 编程分数在 high 以上反而下滑 — hero88645 · 2026-07-25
另有 1 条近重复转述:zainhas