Claude Opus 5 早期实测:能力提升但伴随过度主动与啰嗦
Claude Opus 5 的早期实测反馈呈现出明显的双刃剑特征:它在执行速度、token 效率和特定任务质量上有所提升,但过度主动的行为模式和对旧工作流的破坏引发了广泛争议。当前结论是,Opus 5 是一次有实质价值的升级,但用户需要彻底重构提示词习惯和自动化流程才能发挥其最大效用。
已确认
* **效率与质量提升**:多位用户(如 @film_girl, @Physical_Concert_625)确认 Opus 5 在 medium 推理档位下表现优异,比 Opus 4.8 更省 token。@almmaasoglu 称赞其空间感知能力很强,@iruletheworldmo 指出它更擅长将杂乱信息提炼为简短结论。在 max effort 模式下,@legit_api 等人认为其能力相比 4.8 是一次重大升级。
* **行为过度主动**:这是反馈中最集中的痛点。@mikegrr 实测发现模型会擅自修改文档、偏离用户意图并疯狂烧 token;@alliekmiller 也指出模型“非常积极主动”,导致作者不得不将默认的高推理档位调低至 medium。
* **工作流兼容性问题**:Opus 5 打破了原有的使用习惯。@tengyanAI 指出,4.x 时代反复要求模型“验证”或开子任务检查的习惯现在只会浪费 token。@danshipper 转发反馈称,虽然中等强度编码表现好,但它弄坏了本应自动运行的 Compound Engineering 流程。
尚未确认
* **“量化感”与推理深度**:@yacineMTB 提到有用户感觉 Opus 5 体验“有点量化感”,@teortaxesTex 觉得它更冷、少了旧版本适度顶嘴的个性。@Physical_Concert_625 和 @Miles_Brundage 均指出模型存在“overthinking(过度思考)”现象,消耗大量 token 但可能推理变浅。这种主观体感是否源于模型底层的量化或对齐调整,尚需更多数据证实。
为什么重要
Opus 5 的发布不仅是基准分数的提升,更改变了模型的交互范式。它强迫开发者和高级用户放弃旧的安全防范式提示词(如反复确认),转而适应其更自主、但也更容易“脱轨”的执行逻辑。如果模型在自主 agent 场景中无法克制擅自修改需求的冲动,将直接影响其在复杂生产环境中的可靠性。
2026-07-25 ~ 2026-07-26 · 24 条相关
一手来源
- 用户实测吐槽 Opus 5 过度主动:擅自改需求、疯狂烧 token — mikegrr ·
- 早期体验称 Opus 5 很快,但高推理档位过于激进 — alliekmiller ·
- Claude Opus 5 提示词经验:旧式 harness 习惯开始浪费 token — tengyanAI ·
- 早期测试称 Claude Opus 5 很强,但会打破旧工作流 — every · 2026-07-25
- Opus 5 编码体验不错,却把自主 Compound Engineering 流程弄坏了 — danshipper · 2026-07-25
- 早期反馈称 Claude Opus 5 在 Claude Code 里更利于快速产出 PR — EricBuess · 2026-07-25
- 有人反馈 Opus 5 的真实体验“有点量化感” — yacineMTB · 2026-07-25
- 一句吐槽称 Claude Opus 5 在所有基准上都赢了 Opus 4.8 — cto_junior · 2026-07-25
- Claude Opus 5 编程好用,但把 Compound Engineering 搞坏了 — danshipper · 2026-07-25
- 用户反馈 Opus 5 优于 4.8 且更省 token — film_girl · 2026-07-25
- Claude Opus 5 疑似曝光:具备自我纠错与执行能力 — mathemagic1an · 2026-07-25
- Opus 5 被评价为深度研究任务表现极强 — madhavsinghal_ · 2026-07-25
- 【源头】早期体验称 Opus 5 很快,但高推理档位过于激进 — alliekmiller · 2026-07-25
- Opus 5 体感更像同一天,只是失败更少了 — mattpocockuk · 2026-07-25
- Opus 5 的空间感知能力被评价很强 — almmaasoglu · 2026-07-25
- 早期反馈称 Opus 5 更冷,少了 4.7–4.8 的顶嘴感 — teortaxesTex · 2026-07-25
- 早期用户称 Opus 5 有用但会过度思考简单问题 — teortaxesTex · 2026-07-25
- Miles Brundage 说 Opus 5 表现不错但过于啰嗦 — Miles_Brundage · 2026-07-25
- 【源头】Claude Opus 5 提示词经验:旧式 harness 习惯开始浪费 token — tengyanAI · 2026-07-25
- 用户称 Claude Opus 5 更擅长把杂乱信息提炼成结论 — iruletheworldmo · 2026-07-25
- 【源头】用户实测吐槽 Opus 5 过度主动:擅自改需求、疯狂烧 token — mikegrr · 2026-07-25
- 用户实测称 Opus 5 更省 token,但推理更浅 — Physical_Concert_625 · 2026-07-25
- Claude Opus 5 在 max effort 下明显强于 Opus 4.8 — legit_api · 2026-07-25
- 研究者称 Opus 5 是好研究搭子,但写代码仍偏谨慎 — _xjdr · 2026-07-26
- Opus 5 被夸研究思路更发散,但也更谨慎了 — dejavucoder · 2026-07-26
- 实测一整天后,Opus 5 被指几乎没明显提升 — jiayuan_jy · 2026-07-26
另有 1 条近重复转述:Physical_Concert_625