Agent 性能瓶颈在循环而非模型,优化成本降 30%
Background-Job-862 · reddit · 2026-08-27
作者对比不同 Agent 运行时发现,在模型固定为 Claude Opus 且任务成功率相同(11/14)的情况下,运行时差异巨大:最快与最慢耗时相差 2.5 倍(39 vs 96 分钟),Token 消耗相差 3 倍多(3.85M vs 13M),总成本相差约 30%。
差异主要源于「无聊的运行时细节」:每轮重发的系统提示词量、工具输出累积方式、循环探索与重试的激进程度等。作者认为,Agent 基准测试衡量的是「模型+Harness+提示词+工具循环」的组合,而非单一模型能力。
「编程与Agent」频道最新
- Mac 终端应用 Sub8 招募 Beta 测试 — henrymodis · 2026-08-27
- Sub8 v0.3.32 发布:重构与内存优化 — Daniel_Farinax · 2026-08-27
- GigaMail v0.2.1 发布:本地 MCP 邮件服务支持自动回复 — Soft-Lie-434 · 2026-08-27
- Codex 仓库曝新推理档位 Persistent:持续工作直到被叫停 — zephyr_z9 · 2026-08-27
- 报告详述依赖 AI Agent 的诸多问题与隐患 — dfrsrchtwts · 2026-08-27
- Fathom 创始人:AI 写已知模式近乎完美,深度创新仍是垃圾 — andreisavu · 2026-08-27