640 次请求实测:LLM 路由省 33.2%,但固定中端模型更省 72.9%
smakosh · reddit · 2026-09-26
LLM Gateway 团队自评其基于 Jev 的模型路由功能,与固定模型基线对比(利益相关声明:路由由他们自己构建):
- 实验:80 条 prompt、四种方案、两档输出上限,共 640 次测量请求;任务含 25 个简单任务、15 个精确推理、40 个指令跟随,均为单轮纯文本。
- 8192-token 主实验:路由比 premium 基线省 33.2%(含分类器与存储费用),但调整评分后通过 75/79,premium 为 79/79。
- 固定中价模型基线比路由再省 72.9%,调整评分后通过 76/79。
- 成本结论不确定性大:对 premium 的 95% 置信区间为成本高 4.3% 到低 66.1%,不能推广为普遍省钱的证据。
- 局限:未测试长对话、工具调用、会话复用与 agentic 编码;fallback 关闭。
- 结论:路由确实能压低 premium 账单,但更便宜的固定模型是更强的备选;选型时应对比「你实际会用的模型」与产出质量。
博客附完整 prompt、响应、归一化成本与可复现脚本。
「Infra」频道最新
- 用终端指挥 Agent,何必再租别人的服务器? — StewartalsopIII · 2026-09-26
- MIT 论文:scaling 法则到期,下次翻倍训练成本暴增 6 倍 — DavidLinthicum · 2026-09-26
- Jensen 预测:GOES 硅钢与变压器将比稀土更抢手 — basedjensen · 2026-09-26
- Polymorf 将 OMLX 推理从 150tps 提至近 200tps,一天内打破基准 — HankYeomans · 2026-09-26
- FlashLoop:利用跨循环冗余加速 Looped Transformer,延迟降 1.65 倍 — KyeGomezB · 2026-09-26
- 博主弃用服务器机架:烧主板教训与千美元成本账 — TheZachMueller · 2026-09-26