Agent 推理成本为何暴涨,多智能体把 Token 账单推高数倍
机器之心 · wechat · 2026-07-26
这篇 PRO 解读的核心判断是:AI Agent 正从“能跑”进入“跑得起”的阶段,而真正卡住落地的不是能力,而是 推理成本。
为什么 Agent 会特别烧 Token
- Agent 通常采用 ReAct 式的“思考 → 行动”循环,每一轮都要带着不断增长的历史上下文重新推理,Token 消耗会随着循环次数持续放大。
- 有状态的长时运行 Agent 一旦出现错误,可能会把小故障放大成长时间重试,成本失控。
- 多智能体系统还会额外引入任务分配、状态同步、结果汇总等开销,进一步推高总消耗。
- 文中引用 Anthropic 的研究数据指出:单个 Agent 完成标准任务的 Token 消耗约为普通单轮对话的 4 倍,而多智能体协作架构可达到 15 倍以上。
哪些架构会放大成本
- ReAct:每轮循环都要把历史重新编码,复杂任务里可能反复几十轮,甚至进入难以自行退出的死循环。
- Plan-and-Solve:先规划、再执行的多步拆解虽然更清晰,但如果每一步都再触发 ReAct 循环,成本还会叠加。
- 在真实企业场景里,Agent 往往嵌入自动化流水线;只要没有严格的 token 上限和失败保护,就可能出现“跑着跑着账单爆炸”的情况。
业界在尝试的降本手段
- 把自适应推理预算直接做进模型。
- 在 Agent 与模型之间增加请求级路由,按任务动态选择路径。
- 在输入侧做上下文过滤,先去掉冗余信息。
- 压缩固定提示词和重复流程,减少每次调用的基础开销。
文章举的两个大账单例子
- 一位米哈游工程师周末放出数十个 Agent 做协作测试,未设上限就离开,13 小时内烧掉约 200 万元 Token 成本。
- OpenClaw 创始人 Peter Steinberger 公开账单:3 人团队指挥 100 个 Codex Agent,30 天内消耗 6030 亿 Token、发起 760 万次请求,账单高达 130 万美元。
结论
文章最后抛出的判断是:如果未来基础模型本身就内置了自适应思考和降本能力,第三方 Agent 编排层的价值可能会被重新定义。
所属事件:AI Agent推理成本暴涨成落地新瓶颈(2 条相关)→
「编程与Agent」频道最新
- 桌面上常备一部 iPhone,让 Agent 统一驱动手机与电脑 — signulll · 2026-09-23
- Agent 架构法则:验证器可参与生成反馈,但不得直接晋升候选解 — blaizedsouza · 2026-09-23
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- Seroter 日报:GPT-6 与 Opus 5.5 同日发布,1/4 智能体无人监控 — rseroter · 2026-09-23
- 让 Claude 自动开终端面板装依赖,作者称 tmux 做不到 — letandrewcook · 2026-09-23
- 两小时做出幼儿互动绘本:Agent 访谈式工作流走红 — mimi10v3 · 2026-09-23