2026-09-01
都柏林综述把跨独立LLM的路由和级联收成六种范式,并用何时决策、用何信号、如何计算三维对照现有方法;转述MixLLM以24.18%成本达到GPT-4的97.25%质量。
上线一套大模型,默认把所有请求丢给最强的那颗。简单事实问答也要走一遍昂贵推理,复杂题小模型又扛不住。静态部署按峰值配资源,按均值浪费钱。
都柏林大学 Trinity College 的 ADAPT 中心这篇综述盯的是另一条路:推理时在多颗彼此独立训练的 LLM 之间选模型。它把这件事和 Mixture-of-Experts(MoE,单模型内部的专家路由)切开。MoE 是一层里选专家;这里选的是整颗模型、整套 API、整段计费。
路由做一次决策,把查询映射到池子里的一颗模型。级联(cascade)先让便宜模型试,质量不够再升级。产线里这两套经常叠在一起。
综述没有提出新算法。它把文献收成六种范式,再叠一个三维对照框。
三维框把每篇工作标成三件事:决策发生在生成前、生成后还是多阶段;信号来自查询、模型元数据、回复还是反馈;计算方式是启发式、监督分类、bandit 还是 RL 策略。产线系统几乎都是组合体。第 10 节建议一条控制管线:低成本预路由,生成后校验,再决定接受、润色、拒绝或升级。
这篇是综述,没有自己的统一对照实验。下面这些数字全部来自被引用论文,实验设置互不相同,不能直接横比。
| 来源 | 宣称结果 | 对照 |
| MixLLM | GPT-4 质量的 97.25%,成本 24.18% | 有时延约束 |
| R2-Reasoner | API 费用降 84.46% | 相对该文 SOTA 基线,准确率自称仍有竞争力 |
| GreenServ | 准确率 +22%,累计能耗 -31%,路由开销 <8 ms | 相对随机路由,16 个开源模型 |
| Chuang et al. | 高置信前 20% 查询上 SLM 追平 LLM | 边缘设备上的八种不确定性方法 |
评测资产列得比散落分数更有用。RouterBench 有 11 个模型、7 项任务、超过 40.5 万条预计算结果。RouterEval 声称 8500+ 模型、2 亿条记录。LLMRouterBench 覆盖 21 个数据集、33 个模型、超过 40 万条。RouterEval 写进综述的一条结论是:能用的路由器可以靠模型互补超过最强单模型。
Avengers-Pro 超过 GPT-5-medium 的 Pareto 说法,综述只转述,没有给出可复现的数字表。FrugalGPT 为了简化,路由器采用了与查询无关的模型排列,这个设定会让「路由有多聪明」的贡献变小。
谁在同时打好几家 API,或者本地混部 7B 和 70B,这篇更像一张地图,不是一张配方。先问三个问题就够用:决策要不要看完回复再做、手里到底有哪些信号、路由器自己贵不贵。
延迟敏感、路由器必须很轻:矩阵分解、聚类、小分类器比 1.5B 策略路由器更合适。商业 API 按 token 计费、延迟能忍:Router-R1 / R2-Reasoner 这类多步 RL 才划得来,因为一次路由可能打出多次调用。模型池经常换:优先 ICL-Router、GraphRouter、UniRoute、SCOPE 这类「新模型只建画像、不重训路由器」的设计。不要信模型口头报的自信。探针和困惑度更靠谱,但探针要权重和标注。
这是整理和对照,不是新方法。读完不会多一个开源路由器,但能少走几条已经有人试过的弯路。
综述自己点了三个洞。多数方法换模型、换域就要重训。真正的多阶段级联比单次路由研究得少。多模态路由几乎还没开始,文本上好用的隐状态探针一加视觉 token 就会糊。
第 10 节还标了文献结构缺口。没有任何方法同时用回复级信号做在线自适应:不确定性方法和级联看回复,但部署后阈值是死的;bandit 能在线更新,却只看查询。级联里几乎没有把升级策略本身用 RL 学出来的工作。质量、成本、延迟多数靠一个固定 λ,很少被写成统一的多目标优化。
被引用数字来自不同论文、不同模型池、不同成本模型。97% 质量和 84% 省钱不能加在同一张幻灯片上当「路由的效果」。综述也没有自己跑一遍 RouterBench,把表 2 里的方法摆到同一条 Pareto 上。Table 1 的设计空间矩阵靠着色标记,纯文本里读不全哪些格子是填上的。