清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍

rohanpaul_ai · x · 2026-10-10

清华大学新论文提出 TokenRouter,一个支持 token 级小/大模型路由的服务系统,吞吐最高可达现有方案的 64.15 倍。

背景问题:vLLM、SGLang 等主流推理框架对每个请求只跑一个模型,当答案由两个模型共同生成时,每一步都要等待较慢的那个。

做法:TokenRouter 给每个模型独立的服务器,让它们互相传递工作——在保留已生成文本的 KV cache 的前提下,把写了一半的答案在模型间交接;同时短暂持有请求,使每个模型能以更大的 batch 处理。

结果:在 5 种路由方法上,吞吐相比更强的现有基线提升 2.0164.15 倍。论文:arxiv.org/abs/2610.12242(TokenRouter: Efficient Serving System for Token-Level LLM Routing)。

所属事件:清华发布 TokenRouter:token 级大模型路由解码吞吐提升 64 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →