多供应商 LLM 网关与计费坑复盘
MTreeAI · reddit · 2026-07-20
作者分享了一个 多供应商 LLM 网关 的架构和计费复盘,重点不是“接多少模型”,而是怎么把调用、计费和对账做对。
架构
- 他们把大约 18 家 LLM provider 接到同一个 API 后面。
- 大部分厂商都能走一条 OpenAI-compatible 的统一分发路径;Anthropic、Gemini、Cohere、Replicate 这类少数 provider 需要单独适配。
- tool calling 适配层 则单独拆出来,用纯函数统一不同厂商在 tool schema、toolchoice、并行调用、usage 解析、seed 等方面的差异。
计费设计
- 所有 provider 的价格都会在记录时统一换算成 每 token 的美元成本。
- 每次调用都必须经过一个“计费 chokepoint”:先在行锁下预扣一小笔费用,再发请求,最后按实际用量与预估用量结算并退差额。
- 本地模型按 0 计费。
复盘的 3 个钱相关 bug
- 某个退款路径会 凭空多发 credits,因为失败请求有时退回的钱超过了实际扣款。
- 流式请求在客户端断开时,退款会悄悄丢失,因为 asyncio 抛的是 GeneratorExit,不是 Exception,原来的捕获逻辑没接住。
- 两个函数都往账本写了一次 charge,导致 重复扣费;修复方式是保留单一事实来源。
结论
作者的体会是:集中、正确的计量系统,比聪明的省钱路由更重要。他们的“最便宜 provider”路由逻辑默认是关闭的。
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11