Opus 5 编程分数在 high 以上反而下滑
hero88645 · reddit · 2026-07-25
Opus 5 的 effort 档位不是越高越好
这条帖子的核心观点是:Anthropic 的 Opus 5 在编程任务上,effort 调到 “high” 以上后,分数反而可能下降。作者提到 FrontierCode 上的成绩显示,超过 high 以后模型开始做很多不必要的重构和越界修改,结果把原本的任务搞乱。
他还引用了两组数据来佐证:
- 在 AA-Omniscience 闭卷基准上,Opus 5 的准确率比 Opus 4.8 高约 11%,但幻觉率也高了约 6%。也就是“想得更多”,同时更容易自信地错。
- CodeRabbit 用它在 xhigh 做代码审查时,能执行性评论的精度从 35.2% 提升到 39.3%,但抓到的已知问题从 61.1% 降到 55.2%,而且挑刺数量大约变成了 4 倍。
作者的结论是:最优 effort 档位很可能取决于具体代码库和任务复杂度,并不适合一上来就默认拉满。帖中还提到一个容易忽略的细节:当 Claude 系列产品触发安全分类器时,请求会默认回退到 Opus 4.8。
所属事件:Opus 5 编码测试反转:推理越强分数反而下滑(13 条相关)→
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11