Agent 性能瓶颈在循环而非模型,优化成本降 30%

Background-Job-862 · reddit · 2026-08-27

作者对比不同 Agent 运行时发现,在模型固定为 Claude Opus 且任务成功率相同(11/14)的情况下,运行时差异巨大:最快与最慢耗时相差 2.5 倍(39 vs 96 分钟),Token 消耗相差 3 倍多(3.85M vs 13M),总成本相差约 30%。

差异主要源于「无聊的运行时细节」:每轮重发的系统提示词量、工具输出累积方式、循环探索与重试的激进程度等。作者认为,Agent 基准测试衡量的是「模型+Harness+提示词+工具循环」的组合,而非单一模型能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →