Claude Opus 5 真实编码任务里输给 Fable 5

erebueius · reddit · 2026-07-28

有人在一个大型、复杂的真实项目里测试 Claude Opus 5,结论非常直接:它在各种角色里都表现不佳,连作为子代理读代码都经常误判,还会出现“做了事但马上忘了自己做过”的问题,甚至会把关键原生函数直接注释掉并破坏引擎。

作者把它和 Claude Fable 5 放在同一套 3D 城市构建与后续故障模拟任务里对比:

作者的核心观点是:按 token 计费更便宜,不代表按完成任务计费更便宜。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →