不预知输出token时如何硬性拦截LLM调用

vildanbina · reddit · 2026-07-08

独立开发者分享在调用发起前(尚不知输出token数)对LLM支出设硬性上限的方法:用模型估算输出加上每调用可配置上限,与运行总额比对预算,调用后再用真实token数对账修正;后端慢或宕机时选择fail-open放行,以免为省几美分而搞挂用户应用。已做成开源工具Bursora(Apache 2.0、可自托管),并征求社区在应用层、代理层还是直接承担风险的做法。

所属事件:开源AI智能体预算硬性拦截方案(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →