实测 agent 流量输入输出 token 比 89:1,你的账单大头是 prefill 而非生成
MotherMouse8132 · reddit · 2026-09-10
一位推理基础设施运营者在 Reddit 公布了 24 小时、4100 次请求的真实 agent 流量测量:输入 2.018 亿 token,输出仅 227 万 token,比例高达 89:1(平均每次请求输入 50,239 token、输出 564 token)。
核心结论:
- Agent 每一步都会重发完整对话历史加工具输出,短工具调用换来长结果,下一轮又全部携带——所以你向厂商买的是上下文阅读,不是生成。
- 按 output 价格和 tok/s 对比厂商,对 agent 工作负载是看错了列;真正决定账单的是输入价格、缓存读价格、以及 prefix caching 是否真能跨轮命中。
- 实测同一 64k 上下文:cold prefill 3.95 秒,warm 仅 0.78 秒,快 5 倍且按缓存费率计费。正常情况下 agent 循环首轮后几乎每轮都该命中缓存;命中不了,要么厂商没做缓存,要么你的框架在轮间改动了 prompt 头部(比如 system prompt 里放时间戳就会破坏缓存)。
- KV cache 每 token 成本因架构差异巨大:其服务的 125B MoE 约 12 KB/token,而 GLM-5.3-Flash 约 176 KB/token,相差 15 倍——这决定了厂商在排队前能承载多少长会话。
作者自述是推理服务商、利益相关,但数据与推理过程完整,对选型和框架设计都有直接参考价值。
「Infra」频道最新
- Marvell 高管解释定制 ASIC 低毛利高经营利润率的 NRE 算账逻辑 — BenBajarin · 2026-09-10
- 新 iPhone 内存带宽较 A19 Pro 提 50%,本地 AI 推理看带宽不看 2nm — HankYeomans · 2026-09-10
- 斯坦福Potts提出“token通胀”:token消耗增速或超其实际价值 — ChrisGPotts · 2026-09-10
- RTX 3060 跑 Qwen 27B 量化模型:完整 llama.cpp 配置达 10-20 tokens/s — SummarizedAnu · 2026-09-10
- Traefik Manager 开源:Web UI 管理反代路由,告别手写 YAML — tom_doerr · 2026-09-10
- AI gateway 能否替代 MCP gateway?生产环境边界之争 — Purple_Morning_8735 · 2026-09-10