LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You
cs.CL
2026-08-07
把 LLM 路由统一成一个带成本约束的序列决策过程,配上 18 个候选模型和 16 种以上路由器的开源框架;实测学到的路由比永远选最大模型强 14.6%,多轮路由并不稳赢单轮。
LLM 路由(router)解决一个很实际的问题:没有任何一个模型在所有问题上都最优,贵的模型在某些题上反而答错,便宜的模型在另一些题上够用。路由器就是给每条查询挑一个最该处理它的模型,既能压成本,也能把查询匹配到最擅长的模型,还能按用户偏好调整。
这件事已经有不少做法:在弱模型和强模型之间二选一的二元路由、按成本逐级升级的级联、在查询-模型图上做消息传递的图路由、用强化学习训练的智能体路由。问题在于它们形式各异、代码库互不兼容、监督信号各搞各的、候选模型池也不一样。于是没法公平比较,也分不清性能差异到底来自路由器本身还是周边的实验栈。评测更麻烦:评一个路由器要把候选池里每个模型在每个查询上都跑一遍、用任务指标打分,现有的基准只做了单轮文本,多轮和个性化路由一直没有统一且带成本意识的评测。
作者把所有路由统一成一个带成本约束的序列决策过程。每一步,路由器观察一个状态(查询、可选的用户上下文、累积的交互历史),采取一个动作:要么把当前状态发给候选池里的某个模型、把回复追加进历史,要么终止并汇总出最终答案。目标是最大化「答案质量减去推理成本」。
一个路由器在这个框架下由五类组件刻画:上下文编码器(把状态编码成决策依据)、模型编码器(刻画每个候选)、打分函数和决策规则(把状态和候选表示变成路由动作)、学习信号(把这些组件朝最优策略拟合)。已有路由按观察的状态不同,自然分成三族:只看查询的单轮、看查询加历史的多轮(含智能体)、再看用户上下文的个性化。换路由器只是改配置,不用重写代码。
围绕这个框架,团队做了三件事。一是开源的 LLMRouter 库,六大模块,新增路由器只要继承一个基类、实现一个路由方法和一个损失函数,内置 16 种以上路由器,还能把任意路由器暴露成 OpenAI 兼容的服务,经 OpenClaw 部署到 Slack/Discord,或用 ComfyUI 拖拽原型。
二是把「造监督」自动化:从既有基准采样查询,统一格式,分训练测试;把每条查询发给 18 个候选模型(7B 到 671B 的开源权重,经 Together 和 NVIDIA NIM),收回复并记录 token 数;按任务指标打分、按 token 计价。产出一张稠密的「查询-模型」性能与成本矩阵,既是训练监督又是测试床。加新任务只要一个提示模板和一个指标。
三是基于这套管线建了 xRouteBench,5 个赛道、4,767 个实例:通用任务(MMLU、GSM8K、HumanEval 等)、记忆(长程对话问答)、视觉(图像和视频)、时间序列、个性化。
在性能优先设置下,作者给出几条结论。
| 发现 | 数据 |
| 没有单一路由通吃 | 最强平均是 GraphRouter(45.46),但它在每个任务上都不稳居第一 |
| 学到的路由胜过永远选最大模型 | 相对最强固定基线提升 14.6%;永远选最大模型成本最高、性能只中等 |
| 多轮路由未必赢单轮 | Router-R1 平均 22.30,反而垫底;多轮依赖基座模型(Qwen2.5-3B)能力 |
| 个性化有用,但看怎么建模 | 角色判定下 GMTRouter 68.78 > PersonalizedRouter 67.86 > 最强无个性 EloRouter 66.40 |
真实用户那栏更说明问题:在 Slack 上收集的真实偏好里,个性化路由(83.05)和 EloRouter(82.20)与用户选择吻合度最高。成本收紧时排名还会翻盘:RouterDC 在通用任务质量优先时第一(80.56),到最重成本档掉到 11 个里的第 10;MLPRouter 在视觉赛道质量优先时垫底,却从成本权重 0.4 起反超成第一。
对要把多个模型上线的人来说,这篇把一个原本各说各话的领域理顺了:一个统一抽象、一套能复用的训练和评测管线、一个能直接部署的库。最实用的结论有两个。第一,别无脑选最大模型,它又贵又不一定好,学一个轻量路由器就能在质量和成本之间拿到更好的折中。第二,选哪个路由器要看成本预算,论文给了在不同性能-成本档位下该选谁的具体指引。
候选池只有开源权重模型,最贵的商用闭源旗舰没纳入,这对「成本」和「能力上限」的刻画都有影响。多轮路由的结论受基座模型限制:统一用 Qwen2.5-3B 做分解和聚合,换个更强的基座,多轮未必还是输。个性化赛道用的是角色扮演判定(persona judge)而非全量真人标注,虽然有真实 Slack 偏好做补充,但样本量(15 个用户、40 个会话)不大。路由本身只管「选谁答」,不处理单模型内部的推理优化。