Agent 推理成本为何暴涨,多智能体把 Token 账单推高数倍
机器之心 · wechat · 2026-07-26
这篇 PRO 解读的核心判断是:AI Agent 正从“能跑”进入“跑得起”的阶段,而真正卡住落地的不是能力,而是 推理成本。
为什么 Agent 会特别烧 Token
- Agent 通常采用 ReAct 式的“思考 → 行动”循环,每一轮都要带着不断增长的历史上下文重新推理,Token 消耗会随着循环次数持续放大。
- 有状态的长时运行 Agent 一旦出现错误,可能会把小故障放大成长时间重试,成本失控。
- 多智能体系统还会额外引入任务分配、状态同步、结果汇总等开销,进一步推高总消耗。
- 文中引用 Anthropic 的研究数据指出:单个 Agent 完成标准任务的 Token 消耗约为普通单轮对话的 4 倍,而多智能体协作架构可达到 15 倍以上。
哪些架构会放大成本
- ReAct:每轮循环都要把历史重新编码,复杂任务里可能反复几十轮,甚至进入难以自行退出的死循环。
- Plan-and-Solve:先规划、再执行的多步拆解虽然更清晰,但如果每一步都再触发 ReAct 循环,成本还会叠加。
- 在真实企业场景里,Agent 往往嵌入自动化流水线;只要没有严格的 token 上限和失败保护,就可能出现“跑着跑着账单爆炸”的情况。
业界在尝试的降本手段
- 把自适应推理预算直接做进模型。
- 在 Agent 与模型之间增加请求级路由,按任务动态选择路径。
- 在输入侧做上下文过滤,先去掉冗余信息。
- 压缩固定提示词和重复流程,减少每次调用的基础开销。
文章举的两个大账单例子
- 一位米哈游工程师周末放出数十个 Agent 做协作测试,未设上限就离开,13 小时内烧掉约 200 万元 Token 成本。
- OpenClaw 创始人 Peter Steinberger 公开账单:3 人团队指挥 100 个 Codex Agent,30 天内消耗 6030 亿 Token、发起 760 万次请求,账单高达 130 万美元。
结论
文章最后抛出的判断是:如果未来基础模型本身就内置了自适应思考和降本能力,第三方 Agent 编排层的价值可能会被重新定义。
「编程与Agent」频道最新
- AI 自动化更适合先处理脏输入,再交给软件执行 — A11Zer0 · 2026-07-26
- Andrew Ng 的 OpenWorker 开放测试,可接本地模型和 Slack — Saboo_Shubham_ · 2026-07-26
- Grok 4.5 在多项编码基准登顶,修复成本也更低 — XFreeze · 2026-07-26
- 递归自我改进可能先从 AI 改进造下一代自己的代码开始 — imjustnewatai · 2026-07-26
- 开源 agent 记忆工具在 LongMemEval 上跑到 94.7% — intellinker · 2026-07-26
- 开发者称 Codex 一遇复杂代码就跑偏失控 — AlexanderWillard · 2026-07-26