把简单请求路由到便宜模型后,总账单反而更高了

Massive_Tell_4276 · reddit · 2026-09-17

一位开发者分享了一次反直觉的成本教训:为了让账单更便宜,团队把简单请求路由到便宜模型档位,并一度为单次调用平均成本下降而庆祝,结果总支出反而上升了。

原因是便宜模型经常返回低置信度结果,于是系统反复带着同样的上下文重新做检索,最终回退到昂贵模型。由于置信度阈值设得太松,这种级联被频繁触发,加上上下文重复,一个已解决的任务实际要为两份 prompt 买单。作者感叹:仪表盘每次调用的数据都是对的,但加总出的结论却是错的。

他正在围绕「每个已解决任务的成本」(cost per resolved task)、回退率和整条级联的延迟重建分析,并打算按请求类型做分组切片,因为少数请求类型似乎造成了大多数的重复运行。帖末他在征求:大家如何在不牺牲完成率的前提下调置信度阈值?检索成本算一次还是每阶段都算?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →