Opus 4.8 与 5 同场对决:通过率持平但工程行为迥异

bisonbear2 · reddit · 2026-08-26

作者在自家仓库的 25 个真实任务上对比了 Opus 4.8 和 Opus 5。两者在严格测试通过率上打平(9/25),但行为模式截然不同:

成本方面,Opus 5 因任务模式不同,典型任务便宜约 1.4%,但用 token 多 4%,耗时多 4%。文章指出,仅看通过率会掩盖模型在搜索策略、验证深度和代码可维护性上的真实差异。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →