vLLM 语义路由新招:小模型先行,省 54% 成本还提准 16 分
vllm_project · x · 2026-10-10
- vLLM Semantic Router 推出 System One Auto:不再单一模型决策,Kai 0.6B 先行回答,仅在需要时才调用 Vega 27B。
- 在公开 JevBench 请求上:相比只用 Vega 27B,预估成本降 54%、平均延迟降 20%;相比只用 Kai 0.6B,准确率提升 16.45 分。
「Infra」频道最新
- 月账单 1.14 万美元查不清去向:一个团队的 LLM 成本失控复盘 — vigilAPI · 2026-10-10
- 无人接盘:50 亿美元估值的 AI 数据中心公司撤回上市 — YvesMulkers · 2026-10-10
- MIT 物理学家 Lloyd 1999 年论文算清计算的物理极限 — burny_tech · 2026-10-10
- 曝 NVIDIA 停产 RTX 5090,GB202 芯片将专供 RTX PRO 系列 — chemist_slime · 2026-10-10
- 放弃专用服务器:为什么用笔记本采集传感器流数据更靠谱 — IgorBrigadir · 2026-10-10
- 图灵研究所所长:英国 AI 不应受制于可被关停的外国系统 — nordicinst · 2026-10-10