LLM 成本核算的隐形陷阱:token 口径不一致致用量低估 46 倍
qaiser_mehdi · reddit · 2026-09-23
作者实测数周 LLM 成本后总结:成本错误往往是「安静」的——不报错、数字看起来正常,但实际偏低。
- 各家 token 口径不一致:Google 的 totaltokencount = prompt + candidates + thoughts,思考 token 计入计费;OpenAI 的 reasoningtokens 包含在 completiontokens 内;Anthropic 把 thinking 折入 outputtokens 且不单独报告。若把 candidatescount 当输出成本,最差案例账面显示 3、实际计费 138,低估 46 倍;三个样本分别为 46x、10.6x、3.3x。
- 无主调用:多 subagent 的 harness 不输出每步 usage,作者建议单独列为 UNATTRIBUTED 行而非折入父任务。
- 作者自己工具的两个 bug:崩溃任务被当作零成本完成计入均值(均值低了三分之一);provider 未返回 usage 对象的调用被计为免费。
作者开源了一个零依赖单文件计量工具,并提供 --demo 与 --selftest 命令,同时询问各家框架是否输出 per-step usage。
「编程与Agent」频道最新
- Matt Pocock:与其追模型发布,不如打磨 agent 的运行环境 — mattpocockuk · 2026-09-23
- Uncle Bob:AI 没改变任何事,混乱越大项目越慢 — blaizedsouza · 2026-09-23
- GBrain 开源:把你的记忆、工具与技能接入任意 AI — garrytan · 2026-09-23
- 播客实测:用 AI 工具花 8 美元硬件做出小游戏 — aishashok14 · 2026-09-23
- 四轮实测发现:搜索预算耗尽前,Agent 从不点开原始来源 — memokris · 2026-09-23
- TypeSafe 用单次调用给 RAG 段落打概率分,自动留删抗注入 — marlene_zw · 2026-09-23