专题 · FULL STORY
Claude Opus 5基准测试翻车:推理越强表现越差
Anthropic最新模型Claude Opus 5在多项基准测试中接连暴露缺陷。不仅提升推理强度反而导致编码分数下滑,其概率推理过程也被曝出反复摇摆,在实测中更是落后于GPT-5.6。
2026-07-24 ~ 2026-07-25 · 3 集 · 19 条
第 1 集 · Opus 5 编码测试反转:推理越强分数反而下滑(2026-07-24,13 条)
Claude Opus 5 在 FrontierCode 1.1 基准测试中暴露出反直觉的现象:提升推理强度(至 xhigh 或 max 档位)反而导致编码分数下滑,中等思考模式表现最佳。这一结论为开发者选择模型与配置提供了实用的参考依据。
已确认
在 FrontierCode 1.1 测试中,Opus 5 在中等推理档的表现优于 xhigh 和 max 档。据 @inductionheads 和 @keunwoochoi 转述的系统卡数据,大约 20-30% 的报告基准出现了 max thinking 分数不如 xhigh 的情况。@silasalberti 和 @hero88645 指出,降分的核心原因在于 FrontierCode 评估的不仅是正确率,还包含代码的 merge-ability(可合并性)。其 scope 指标会惩罚 Opus 5 在高推理状态下产生的过度修改或不合规的代码范围扩张。此外,@thesaraharminta 补充了 Vibe Code Bench 的数据,指出 Opus 5 的准确率从 low(76.7%)、medium(82.0%)一路升至 high(88.0%),证明在常规代码生成中高推理档位仍有优势,且高推理档位达到了最佳性价比。
尚未确认
@draginol 提出一种推测,Opus 5 在高 effort 下成绩不佳,可能并非主模型能力衰退,而是因为该模式下更多依赖非 Opus 5 的子代理分担任务,从而拉低了整体评测分数。这一机制仍需更多内部细节证实。
为什么重要
这一发现打破了“思考越多、性能越强”的常规认知。@seh0872 和 @brandongalang 认为,这证明中等推理档位的 Opus 5 是最适合日常默认使用的状态,不仅规避了“想太多”导致的代码越界问题,还能有效控制 Opus 档位的高昂价格成本,为 AI 编程工作流提供了更具性价比的配置方案。
- Anthropic effort 档位与基准数据,给模型选择提供实用参考 — seh0872 · 2026-07-24
- FrontierCode 显示 Claude Opus 5 在中等推理档最适合默认使用 — brandon_galang · 2026-07-25
- 图表显示 Opus 5 在中等思考模式下编码性能最佳 — dejavucoder · 2026-07-25
- FrontierCode 图表显示 Claude Opus 5 中等推理最好 — zainhas · 2026-07-25
- Claude Opus 5 在 FrontierCode 上中等推理反而更强 — zainhas · 2026-07-25
- FrontierCode 1.1 显示 Opus 5 在 xhigh 和 max 推理档会降分 — inductionheads · 2026-07-25
- FrontierCode 1.1 显示 Opus 5 在更强推理下反而降分 — andrew_n_carr · 2026-07-25
- Opus 5 max thinking 在两三成基准上反而不如 xhigh — keunwoochoi · 2026-07-25
- FrontierCode 设计解释了 Opus 5 推理越强分数越低 — silasalberti · 2026-07-25
- Opus 5 在 FrontierCode 上中等 effort 反超更高 effort — kieranklaassen · 2026-07-25
- Claude Opus 5 可能因子代理分工而拉低硬测成绩 — draginol · 2026-07-25
- Claude Opus 5 在高推理档位达到最佳性价比 — thesaraharminta · 2026-07-25
- Opus 5 编程分数在 high 以上反而下滑 — hero88645 · 2026-07-25
第 2 集 · Claude Opus 5被曝概率推理过程反复摇摆(2026-07-25,3 条)
基准测试截图显示,Anthropic最新发布的Claude Opus 5在处理概率推理题时表现出明显的不稳定性。在解答一道题目时,该模型在1/3和2/5等多个看似都说得通的候选答案之间反复修改,累计改了多达30次主意后才勉强收敛至最终结论。这一现象引发了外界对该模型底层推理机制可靠性的担忧。
- Claude Opus 5 在 1/3 和 2/5 之间反复改答案 — Sauers_ · 2026-07-25
- Claude Opus 5 在概率题上反复改 30 次答案 — scaling01 · 2026-07-25
- 第二张截图再次显示 Claude Opus 5 推理不稳定 — scaling01 · 2026-07-25
第 3 集 · Bug实测:GPT-5.6修复22个bug领先Claude Opus 5(2026-07-25,3 条)
在针对代码修复能力的Bug Hunt Bench实测中,测试者在约2.8万行的VS Code扩展仓库中隐藏了45个可通过测试的bug。结果显示,GPT-5.6 Sol成功修复22个bug表现最佳,而Claude Opus 5修复了约11至12个,且识别出了旧版本漏掉的问题,Opus 4.8仅修复2个。
- Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 在代码任务中识别出旧版漏掉的问题 — PawelHuryn · 2026-07-25