实测 Claude Opus 5:重构多智能体工作流释放怪兽级潜力

近期多位开发者对 Claude Opus 5 的实测表明,该模型在传统提示词模式下常出现提前停工等问题,但一旦重构为循环、图结构和多智能体编排的工作流,便能释放出惊人的生成与解决复杂任务的能力。

已确认

工作流适配与突破:@thedealdirector 转述的一手反馈指出,Opus 5 在旧有插件工作流中会顶着指令走、提前停工,删掉旧工作流后表现才变顺手。@minchoi 建议将其应用于循环、审阅者和并行 agent 架构中,此时复杂任务表现甚至能超过 Fable。

强大的内容生成:@minchoi 展示 Opus 5 在不到 10 分钟内,一次性生成了 38 秒的电影感序列,且做到零修改。@levelsio 实测让 Opus 5 结合历史地图与自主研究,重建了 1660 年的新阿姆斯特丹(纽约),整体基本“一把成型”,仅存在运河细节怪异等小瑕疵。

前沿基准与长上下文应用:@socialwithaayan 指出 Claude 在 ARC-AGI-3 测试中得分 30.2%,约为第二名的三倍。基于其 100 万 token 的上下文窗口,可进行全代码库架构审计;结合 2026 年 5 月的知识截止期,可构建分级的事实核查工作流。

为什么重要

这些测试表明,顶级 AI 模型的能力释放越来越依赖于特定的系统架构。放弃传统的单线指令,转向多智能体协同、循环审阅机制以及超长上下文的深度利用,正成为未来充分发挥大模型潜力的标准解法。

2026-07-26 ~ 2026-07-27 · 10 条相关

一手来源