清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍
rohanpaul_ai · x · 2026-10-10
清华大学新论文提出 TokenRouter,一个支持 token 级小/大模型路由的服务系统,吞吐最高可达现有方案的 64.15 倍。
背景问题:vLLM、SGLang 等主流推理框架对每个请求只跑一个模型,当答案由两个模型共同生成时,每一步都要等待较慢的那个。
做法:TokenRouter 给每个模型独立的服务器,让它们互相传递工作——在保留已生成文本的 KV cache 的前提下,把写了一半的答案在模型间交接;同时短暂持有请求,使每个模型能以更大的 batch 处理。
结果:在 5 种路由方法上,吞吐相比更强的现有基线提升 2.0164.15 倍。论文:arxiv.org/abs/2610.12242(TokenRouter: Efficient Serving System for Token-Level LLM Routing)。
所属事件:清华发布 TokenRouter:token 级大模型路由解码吞吐提升 64 倍(2 条相关)→
「Infra」频道最新
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10
- MosaicML Streaming 作者背书,Datology 发布确定性数据加载器 Zephon — josh_wills · 2026-10-10
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 黄仁勋女婿任英伟达VP,苹果iPhone 18 Pro订单削减15%起 — 创业邦 · 2026-10-10
- 前英伟达 GPU 老兵创业做物理 AI 芯片:性能提 5 倍成本降 80% — 创业邦 · 2026-10-10