16 个语义问题路由 LLM,40 维概率特征胜过 embedding 与最强单模型

SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing

Vasilis Perifanis, Nikolaos Pavlidis, Symeon Symeonidis

cs.AI, cs.CL, cs.LG

2026-09-28

把 query 拆成 16 个带概率分布的语义判断,再学各模型在此上的表现来做路由,LLMRouterBench 分组评测准确率 72.64%,最强固定模型只有 69.23%。

这篇在解决什么

LLM 路由要回答的问题很具体:一条请求进来,交给候选模型池里的哪一个。现有路由器大多从 query embedding、模型表示或相似样本聚类里直接学这个决策。这类表示捕捉的是「像不像」,但相似不等于需求相同:同是 Python 请求,查字典推导式语法和排查多个异步函数间的竞态条件,对模型能力的要求差得很远。LLMRouterBench 的统一评测还发现,一批领先路由器挤在 7072 的窄带里,都逼近按数据集选最优模型的 Dataset Oracle,大部分可测收益来自粗粒度领域识别,query 级别的信息没被用上。SeLMRoute 的问题意识就在这里:能不能用一组显式、可读的任务需求描述做路由,又不回到大维度表示。

方法

核心是把路由函数拆成三段,各管一件事。

拆分换来三个实际好处:换模型池、换部署目标不用重抽语义;新增模型只补性能校准数据;每次路由都能翻出「高代码推理、高精确度、高约束密度」这样的证据链。评测还做了防泄漏:相同归一化 query 强制同折,11,481 条实例归并成 11,423 个组。

结果

主实验在 LLMRouterBench 性能导向设置:15 个数据集、20 个轻量模型、11,481 条 query。

表示AvgAccGain@B
SeLMRoute 概率质量(40 维)72.08 ± 0.455.72%
SeLMRoute 全量(88 维)71.30 ± 0.184.58%
SeLMRoute 硬标签(16 维)71.20 ± 0.594.41%
GTE-Qwen2 稠密向量 + CatBoost71.16 ± 0.744.34%
只有领域标签71.08 ± 1.034.45%
TF-IDF70.87 ± 0.783.82%

参照系:Best Single 68.81,Dataset Oracle 73.94,Instance Oracle 91.91(五次 70/30 分组划分)。分组五折 OOF 下概率质量到 72.64%,最强固定候选 Qwen3-8B 是 69.23%,差 3.4 个点,离 Dataset Oracle 只剩 1.86 个点。

消融里信息量最大的几条:

分布外是分水岭。留出单个数据集,语义表示还扛得住(67.02%,GTE-Qwen2 为 67.29%);留出整个领域,稠密向量明显更强(67.31% vs 65.66%)。

成本设置(13 个旗舰模型、10 个数据集、12,446 条 query,参照 GPT-5)五个分组划分 PerfGain 全正,平均 +2.66% ± 1.85%,但严格协议下没有一个划分达成省钱,达标的两个配置反而比 GPT-5 贵 0.10% 和 1.58%。

开销:语义抽取每条 query 约 1,607 个输入 token、平均 350ms,按评测时价格折合每千条 0.0675 美元;下游 CatBoost 单条 1.23ms。

为什么重要

40 个人能读懂的特征,均值压过 7B 参数的 GTE-Qwen2 embedding,这是给从业者最抓眼的数字。路由证据变得可审计,路由错了能查到是哪条语义判断出了问题。架构拆分也实用:换目标、换池子不动前段,新模型只补校准数据。直选消融给想跳过中间环节的人泼了冷水,3.79 个点的差距说明实测结果比 LLM 的自我判断可靠。

位置也要看清:离 Dataset Oracle 只差 1.86 个点,离 Instance Oracle 还有近 20 个点。它和 LLMRouterBench 上那批领先路由器一样,主要吃的还是数据集级规律,是一次扎实的表示改进,谈不上路由能力的跳变。

局限与存疑

论文自己披露的几条都该记着:

读下来还有两点保留。主抽取器 JEV 来自作者自己的公司(Indigma),开源替代 Laya 掉 2.1 个点,接口可换成立,换了不掉点不成立。每条 query 多出 350ms 左右的抽取延迟,对延迟敏感的在线服务是实打实的成本,论文只在开销一节顺带带过。

术语

原文与代码

相关论文

全部论文解读