Opus 4.8 与 5 同场对决:通过率持平但工程行为迥异
bisonbear2 · reddit · 2026-08-26
作者在自家仓库的 25 个真实任务上对比了 Opus 4.8 和 Opus 5。两者在严格测试通过率上打平(9/25),但行为模式截然不同:
- Opus 5:搜索范围更广,验证更多。在 25 个任务中的 18 个使用了更多 Shell 命令,15 个使用了更多测试命令,修改了更多文件,更倾向于探索和验证。
- Opus 4.8:更收敛。在 20 个任务中留下的代码足迹更小,更接近实际合并的变更,把预算花在编辑而非探索上。
成本方面,Opus 5 因任务模式不同,典型任务便宜约 1.4%,但用 token 多 4%,耗时多 4%。文章指出,仅看通过率会掩盖模型在搜索策略、验证深度和代码可维护性上的真实差异。
「编程与Agent」频道最新
- 手握多个AI Agent各干各的,用什么工具统一管理任务? — ibmmo · 2026-08-27
- 开发者拒绝让 AI 代写的代码场景讨论 — Pyrro-nft · 2026-08-27
- 开发者:一半代码用于防止 AI 暴走 — kevinnbass · 2026-08-27
- AI 时代工程重心转向验证:自动化与同理心并重 — arpit_bhayani · 2026-08-27
- 开源项目 WaterCrawl:把网页内容抓取并转换为 LLM 就绪数据 — tom_doerr · 2026-08-27
- Grok Bot 进阶指南:打造 AI 团队工作流 — minchoi · 2026-08-27