开发者实测 Opus 5:编码强但难驾驭,复杂任务落后 Fable

Anthropic 发布的 Opus 5 模型在开发者群体中引发了广泛的实际使用评估。多位开发者反馈,尽管 Opus 5 在编码能力上表现出色,但在处理复杂任务和长周期协作时却更难驾驭,整体表现落后于 Fable,且在公开基准测试中的领先优势与真实体验存在脱节。

已确认

开发者们通过高强度的实测得出了一些共识。antirez 经过两天测试认为 Opus 5 取得了实质性进步,填补了此前的差距,但并未在整体表现上明显超越 Fable。doodlestein 指出,即便排除上下文退化的干扰,Opus 5 在复杂任务中依然更容易犯错,相比之下 Fable 在行动前会进行更充分的思考,表现更稳。petergyang 转述的分析也印证了这一点:Opus 5 在公开基准测试上占优,但在真实任务里却明显落后于 Fable,说明榜单已无法真实区分前沿模型。johnlindquist 转发的 24 小时编码实测同样表明,两者代码质量都很高,但 Fable 5 在处理开放式需求时更容易“一次做对”。

尚未确认

关于 Opus 5 在长周期任务中具体为何更易出错,目前仍处于开发者主观探讨阶段。有 Reddit 用户认为它比早期版本更容易失控,但具体的机制和触发条件尚无定论。

为什么重要

前沿 AI 模型的基准测试分数与真实开发体验的脱节正成为行业焦点。doodlestein 提出了一个反直觉的成本考量:在硬调试或复杂实现任务中,如果模型因反复出错而需要多次返工,其最终的总成本和时间消耗可能反而高于 Fable 这类能“一次做对”的模型。这意味着开发者在选型时不能仅看跑分,更需要考量模型在复杂流程中的思考深度与执行稳定性。

2026-07-26 ~ 2026-07-27 · 7 条相关

一手来源