把简单请求路由到便宜模型后,总账单反而更高了
Massive_Tell_4276 · reddit · 2026-09-17
一位开发者分享了一次反直觉的成本教训:为了让账单更便宜,团队把简单请求路由到便宜模型档位,并一度为单次调用平均成本下降而庆祝,结果总支出反而上升了。
原因是便宜模型经常返回低置信度结果,于是系统反复带着同样的上下文重新做检索,最终回退到昂贵模型。由于置信度阈值设得太松,这种级联被频繁触发,加上上下文重复,一个已解决的任务实际要为两份 prompt 买单。作者感叹:仪表盘每次调用的数据都是对的,但加总出的结论却是错的。
他正在围绕「每个已解决任务的成本」(cost per resolved task)、回退率和整条级联的延迟重建分析,并打算按请求类型做分组切片,因为少数请求类型似乎造成了大多数的重复运行。帖末他在征求:大家如何在不牺牲完成率的前提下调置信度阈值?检索成本算一次还是每阶段都算?
「编程与Agent」频道最新
- TypeSafe AI 演示逐行语义搜索:一次请求给 218 行打相关性分 — hackgoofer · 2026-09-17
- 「Vibe automating」:把行政杂活全部交给 AI 自动化正成为新玩法 — aronkor · 2026-09-17
- Victor Taelin 宣布 Bend2 明日发布:面向后 AGI 经济的语言设计 — Birchlabs · 2026-09-17
- 用户实测 Devin 上 Fable 5.1+SWE-2 融合模式:连续工作3小时仅耗1%额度 — CtrlAltDwayne · 2026-09-17
- 实战:让 vLLM Prefix Cache 在 Agent 多轮间保持命中 — bolts98 · 2026-09-17
- 开发者历经数次重写,用新一代模型完成艺术角色生成器 — generativist · 2026-09-17