Claude Opus 5 真实编码任务里输给 Fable 5
erebueius · reddit · 2026-07-28
有人在一个大型、复杂的真实项目里测试 Claude Opus 5,结论非常直接:它在各种角色里都表现不佳,连作为子代理读代码都经常误判,还会出现“做了事但马上忘了自己做过”的问题,甚至会把关键原生函数直接注释掉并破坏引擎。
作者把它和 Claude Fable 5 放在同一套 3D 城市构建与后续故障模拟任务里对比:
- 3D 城市任务里,Fable 5 更快完成,生成结果也明显更好;
- 雨灾/火灾/Slack/Google Sheets 扩展任务里,Fable 5 依然更省运行时 token、工具调用更少;
- 在 23 个真实工具调用测试 中,Fable 5 得分 21/23,Opus 5 为 20/23。
作者的核心观点是:按 token 计费更便宜,不代表按完成任务计费更便宜。
「编程与Agent」频道最新
- 经验蒸馏复现:保住 44.1% 的代理 ICL 增益 — burny_tech · 2026-07-29
- Agensis 把 AI agents 变成团队成员并提供本地推理 — jasonkneen · 2026-07-29
- Grok Build 新增 MCP CLI 控制和 /delete 会话命令 — mark_k · 2026-07-29
- LLM 编程工作流加审阅门,防止把所有方法都写进实现 — hypergraphr · 2026-07-29
- 贾扬清吴恩达同日官宣创业:瞄准AI工程团队与个性化教育 — 机器之心 · 2026-07-29
- GPT 修代码截图成了经典自信翻车梗 — hrishioa · 2026-07-29