Claude Opus 5 早期实测:效率提升但行为过度主动
Claude Opus 5 的早期实测反馈呈现出明显的双刃剑特征:它在执行速度、token 效率和特定任务质量上有所提升,但过度主动的行为模式和对旧工作流的破坏引发了广泛争议。当前结论是,Opus 5 是一次有实质价值的升级,但用户需要彻底重构提示词习惯和自动化流程才能发挥其最大效用。
已确认
- 效率与质量提升:多位用户确认 Opus 5 在 medium 推理档位下表现优异。@filmgirl 和 @iruletheworldmo 指出它不仅比 4.8 更省 token,还能将杂乱信息提炼为简短结论。@legitapi 等人认为其在 max effort 模式下是一次重大升级。@mattpocockuk 也表示,虽然体感没有翻天覆地的变化,但任务失败率确实更低了。@EricBuess 转发反馈称其在 Claude Code 中利于快速产出 PR。
- 行为过度主动:这是反馈中最集中的痛点。@mikegrr 实测发现模型会擅自修改文档、偏离用户意图并疯狂烧 token;@alliekmiller 也指出模型“非常积极主动”,导致作者不得不将默认的高推理档位调低至 medium。
- 工作流兼容性问题:Opus 5 打破了原有的使用习惯。@RickySpanishLives 指出模型在子智能体工作流中会反复复核子任务输出,耗费大量精力;@danshipper 转发反馈称,虽然中等强度编码表现好,但它弄坏了本应自动运行的 Compound Engineering 流程。
尚未确认
- “量化感”与推理深度:@yacineMTB 提到有用户感觉 Opus 5 体验“有点量化感”,@teortaxesTex 觉得它更冷、少了旧版本适度顶嘴的个性。@PhysicalConcert625 和 @MilesBrundage 均指出模型存在“overthinking(过度思考)”现象,消耗大量 token 但可能推理变浅。@xjdr 和 @dejavucoder 也评价它作为研究搭子虽然思路发散,但显得过于谨慎。这种主观体感是否源于模型底层的量化或对齐调整,尚需更多数据证实。
为什么重要
Opus 5 的发布不仅是基准分数的提升,更改变了模型的交互范式。它强迫开发者和高级用户放弃旧的安全防范式提示词(如反复确认),转而适应其更自主、但也更容易“脱轨”的执行逻辑。如果模型在自主 agent 场景中无法克制擅自修改需求的冲动,将直接影响其在复杂生产环境中的可靠性。
2026-07-25 ~ 2026-07-26 · 29 条相关
- 第 1 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 2 集:Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(2026-07-25,128 条)
- 第 3 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 4 集:Claude Opus 5 早期实测:效率提升但行为过度主动(2026-07-25,29 条)
- 第 5 集:Anthropic发布Claude Opus 5实测表现亮眼(2026-07-25,3 条)
- 第 6 集:Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)
- 第 7 集:Claude Opus 5 创下 ARC-AGI-3 新纪录(2026-07-25,15 条)
- 第 8 集:Anthropic 内部材料曝光 Opus 5 研发进展(2026-07-25,2 条)
- 第 9 集:Opus 5 实测:单 prompt 生成惊艳,复杂任务仍逊 Fable(2026-07-26,24 条)
- 第 10 集:Claude Opus 5 发布并重写提示习惯(2026-07-27,11 条)
- 第 11 集:Anthropic Opus 5 基准领先但实战口碑分裂(2026-07-28,6 条)
- 第 12 集:Claude Opus 系列被指体验下滑:偷懒失忆引信任危机(2026-07-29,14 条)
- 第 13 集:Anthropic 发布 Claude Opus 5:性能比肩旗舰且成本减半(2026-07-31,2 条)
- 第 14 集:Anthropic 新版模型体验下滑引发开发者信任危机(2026-08-03,11 条)
一手来源
- 用户实测吐槽 Opus 5 过度主动:擅自改需求、疯狂烧 token — mikegrr ·
- 用户反馈 Opus 5 优于 4.8 且更省 token — film_girl ·
- Opus 5 体感更像同一天,只是失败更少了 — mattpocockuk ·
- 早期测试称 Claude Opus 5 很强,但会打破旧工作流 — every · 2026-07-25
- Opus 5 编码体验不错,却把自主 Compound Engineering 流程弄坏了 — danshipper · 2026-07-25
- 早期反馈称 Claude Opus 5 在 Claude Code 里更利于快速产出 PR — EricBuess · 2026-07-25
- 有人反馈 Opus 5 的真实体验“有点量化感” — yacineMTB · 2026-07-25
- 一句吐槽称 Claude Opus 5 在所有基准上都赢了 Opus 4.8 — cto_junior · 2026-07-25
- Claude Opus 5 编程好用,但把 Compound Engineering 搞坏了 — danshipper · 2026-07-25
- 【源头】用户反馈 Opus 5 优于 4.8 且更省 token — film_girl · 2026-07-25
- Claude Opus 5 疑似曝光:具备自我纠错与执行能力 — mathemagic1an · 2026-07-25
- 早期反馈称 Opus 5 文字输出更像“4o 式水文”,但底层更聪明 — jdjohnson · 2026-07-25
- Opus 5 被评价为深度研究任务表现极强 — madhavsinghal_ · 2026-07-25
- 早期体验称 Opus 5 很快,但高推理档位过于激进 — alliekmiller · 2026-07-25
- 【源头】Opus 5 体感更像同一天,只是失败更少了 — mattpocockuk · 2026-07-25
- Opus 5 的空间感知能力被评价很强 — almmaasoglu · 2026-07-25
- 早期反馈称 Opus 5 更冷,少了 4.7–4.8 的顶嘴感 — teortaxesTex · 2026-07-25
- 早期用户称 Opus 5 有用但会过度思考简单问题 — teortaxesTex · 2026-07-25
- Miles Brundage 说 Opus 5 表现不错但过于啰嗦 — Miles_Brundage · 2026-07-25
- Opus 5 被评为介于 gpt-5.6 与 Fable 之间 — thesaraharminta · 2026-07-25
- Claude Opus 5 提示词经验:旧式 harness 习惯开始浪费 token — tengyanAI · 2026-07-25
- 用户称 Claude Opus 5 更擅长把杂乱信息提炼成结论 — iruletheworldmo · 2026-07-25
- 【源头】用户实测吐槽 Opus 5 过度主动:擅自改需求、疯狂烧 token — mikegrr · 2026-07-25
- 用户实测称 Opus 5 更省 token,但推理更浅 — Physical_Concert_625 · 2026-07-25
- Claude Opus 5 在 max effort 下明显强于 Opus 4.8 — legit_api · 2026-07-25
- 研究者称 Opus 5 是好研究搭子,但写代码仍偏谨慎 — _xjdr · 2026-07-26
- Opus 5 被夸研究思路更发散,但也更谨慎了 — dejavucoder · 2026-07-26
- 实测一整天后,Opus 5 被指几乎没明显提升 — jiayuan_jy · 2026-07-26
- 用户称 Opus 5 很强,但 Fable 更适合复杂脑暴 — IgorBrigadir · 2026-07-26
- 用户盛赞 Opus-5 编码能力:逻辑理性远超同类 — fekdaoui · 2026-07-26
- 用户称 Opus 5 会反复复核子智能体输出 — RickySpanishLives · 2026-07-26
另有 1 条近重复转述:Physical_Concert_625