早期测试称 Claude Opus 5 很强,但会打破旧工作流
every · x · 2026-07-25
早期测试认为 Claude Opus 5 很强,但和旧工作流不太兼容
这条帖子转述了对 Claude Opus 5 的一轮内部测试,覆盖编码、写作、知识工作和内部 agent。
核心反馈是:
- 模型会和指令“顶嘴”,有时会提前停下,和现有 skills / plugins(例如 Compound Engineering)配合不好。
- 把原有技能栈删掉、从头重建后,表现明显变好。
- 在更简化的工作流里,它能展示出很亮眼的能力。
- 最大警告是 向后兼容性:如果你已有复杂工作流,可能需要重做。
引用的官方表述则是:Opus 5 是更主动、更有思考性的模型,能力接近前沿,同时价格只有一半。
所属事件:Claude Opus 5 早期实测:效率提升但行为过度主动(29 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11