Opus 5 实测:单次生成惊艳,复杂任务仍逊于 Fable

Claude Opus 5 发布不足三天便引爆了开发者社区的实测热潮。该模型在单次提示词生成复杂应用(如第一人称射击游戏、Minecraft 复刻、滑雪板模拟)方面展现出惊艳的 3D 与物理模拟能力,整体实力强于 Opus 4.8。然而,在长程任务和复杂开发场景的深度评测中,多位开发者认为其综合表现仍落后于 Fable,且公开基准分数与真实体验脱节的问题再次凸显。

已确认

* **单次生成能力突出**:@eyishazyer 等用户展示了 Opus 5 仅凭单条提示词生成的完整射击游戏、咨询级表格幻灯片以及带有实时光照和方块物理的 Minecraft 复刻,其 3D 表现被 @TAbrodi 评价为“惊艳”。

* **整体优于前代**:@eyishazyer 确认 Opus 5 整体能力超越 Opus 4.8,但也继承了 Fable 的一些风格怪癖(如 Density 和 FableSpeak)。

* **复杂任务表现不及 Fable**:@doodlestein 和 @petergyang 指出,尽管 Opus 5 基准分更高,但在处理复杂任务时思考深度不足,更易出错,表现不如 Fable 稳定。@johnlindquist 也认为 Fable 5 在开放式编码上更强。

* **长程协作存在痛点**:@Veraticus 反映 Opus 5 在长周期任务中更难驾驭;@doodlestein 补充说,由于需要反复返工,Opus 5 在硬调试中的实际成本可能高于“一次做对”的 Fable。

* **适合作为子代理**:@iskander 转述观点认为,Opus 5 技术能干但高层创意发散不够,更适合由另一个主控模型来调度的“子代理”角色。

尚未确认

* @antirez 提到 Opus 5 虽然取得了实质性进步,填补了差距,但是否已在整体体验上重新领先于其他竞品(如 Sol),仍需更多实测验证。

为什么重要

Opus 5 的发布再次印证了当前 AI 模型“基准测试分数”与“真实开发体验”严重脱节的现象。对于开发者而言,模型在处理硬核调试和长程复杂任务时的稳定性与“一次做对”的概率,远比华丽的跑分或单次 Demo 更能决定实际的生产效率与使用成本。

2026-07-26 ~ 2026-07-27 · 17 条相关

事件全程(共 20 集)→

一手来源

另有 1 条近重复转述:eyishazyer