Opus 5 编码测试反转:推理越强分数反而下滑

Claude Opus 5 在 FrontierCode 1.1 基准测试中暴露出反直觉的现象:提升推理强度(至 xhigh 或 max 档位)反而导致编码分数下滑,中等思考模式表现最佳。这一结论为开发者选择模型与配置提供了实用的参考依据。

已确认

在 FrontierCode 1.1 测试中,Opus 5 在中等推理档的表现优于 xhigh 和 max 档。据 @inductionheads 和 @keunwoochoi 转述的系统卡数据,大约 20-30% 的报告基准出现了 max thinking 分数不如 xhigh 的情况。@silasalberti 和 @hero88645 指出,降分的核心原因在于 FrontierCode 评估的不仅是正确率,还包含代码的 merge-ability(可合并性)。其 scope 指标会惩罚 Opus 5 在高推理状态下产生的过度修改或不合规的代码范围扩张。此外,@thesaraharminta 补充了 Vibe Code Bench 的数据,指出 Opus 5 的准确率从 low(76.7%)、medium(82.0%)一路升至 high(88.0%),证明在常规代码生成中高推理档位仍有优势,且高推理档位达到了最佳性价比。

尚未确认

@draginol 提出一种推测,Opus 5 在高 effort 下成绩不佳,可能并非主模型能力衰退,而是因为该模式下更多依赖非 Opus 5 的子代理分担任务,从而拉低了整体评测分数。这一机制仍需更多内部细节证实。

为什么重要

这一发现打破了“思考越多、性能越强”的常规认知。@seh0872 和 @brandongalang 认为,这证明中等推理档位的 Opus 5 是最适合日常默认使用的状态,不仅规避了“想太多”导致的代码越界问题,还能有效控制 Opus 档位的高昂价格成本,为 AI 编程工作流提供了更具性价比的配置方案。

2026-07-24 ~ 2026-07-25 · 13 条相关

事件全程(共 3 集)→

一手来源

另有 1 条近重复转述:zainhas