TokenRouter 实现 token 级 LLM 路由服务,解码吞吐提升最高 64 倍
nics-efc · hf · 2026-10-09
token 级 LLM 路由可在成本-质量帕累托前沿上带来显著收益,但现有推理系统基于单模型假设,难以高效支撑。清华 nics-efc 团队发布 TokenRouter 服务系统:
- 遵循「请求为中心的编程、模型为中心的执行」:开发者以单请求视角描述路由逻辑,运行时为每个 LLM 启动 subserver 并异步分发
- 每个 subserver 采用延迟批处理调度器,最优超参数由系统吞吐数学模型推导
- 在多种路由算法、负载与模型对上,解码吞吐比现有系统高 2.01–64.15 倍
代码已开源:github.com/thu-nics/TokenRouter
「Infra」频道最新
- OpenAI 收入口径引抛售:SOX 跌 3.4%,TSMC 9 月营收却逆势涨 55% — tengyanAI · 2026-10-09
- 40G 显存训练 Qwen3.8-Flash-Next:LoRA over GGUF 无需 CPU offload — woct0rdho · 2026-10-09
- Nunchux 推理引擎入驻 AMD AI 推理生态,优化 Instinct GPU 多模态推理 — junyanz89 · 2026-10-09
- tinygrad 用 4 台自研 tinybox 承载 GitHub Actions CI — AIFlow_ML · 2026-10-09
- OpenAI 万级并发 Agent 耗 1300 亿 token,slime v0.4.0 应对 RL 扩展 — teortaxesTex · 2026-10-09
- SparseDecoding 解码感知剪枝:对齐生成分布,A100 解码提速至 1.48 倍 — encodelab · 2026-10-09