Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation
Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein
cs.AI
2026-08-21
DeepMind把多模型路由收成潘多拉开盒:便宜kNN默认算,贵估分只在信息价值盖过成本时才查。三套任务上regret加检查成本贴住穷举下沿,EmbedLLM平均总代价0.386对g-only的2.356。
多模型路由的标准动作是给每个候选估一个期望回报,再挑最高的。估计从哪来,路径很多:嵌入近邻、微调打分器、先跑一段思维链、先检索再看文档。这些估分器自己就有价格,已有工作几乎把估分当成免费操作。
Google DeepMind 把问题往前推了一步:什么时候该为更准的分数再付钱。便宜估计快但噪,贵估计准但贵,路由决策本身是一次带成本的搜索。
每个 specialist 当成 Weitzman 1979 年的盒子。便宜估分 \(f\) 默认就算:预训练编码器嵌 prompt,在标定集里取余弦近邻,邻居平均回报当估计。贵估分 \(g\) 才是打开盒子。三个实验域里,打开盒子看到的信息不一样。
标定集均方误差:Math 上 \(f\) 0.154、\(g\) 0.096;RAG 上 0.175 对 0.109;EmbedLLM 上 0.266 对 0.198。按 Gemini API 标价折的成本比 \(cg/cf\) 分别是 5.8、大于 7000、1.6。RAG 之所以极端,是检索本身很贵。
打开盒子值不值,用高斯信号模型写成闭式。\(f\) 给出 \(g\) 的条件均值和残差方差,当前最好分数当外部选项,期望上行刚好等于检查成本时的那个外部选项就是预约价格。按预约价格从高到低开,已经拿到的值超过剩下盒子的最高预约价就停。
还做了非强制打开版:允许不打开就选中某个盒子,对应 backup price。最优自适应策略是 NP-hard,实际用 committing policy,留一个盒子当退路,其余按强制打开搜,100 次蒙特卡洛估期望收益再决定留哪个。EmbedLLM 里同类模型高度相关,每打开一个就用多元高斯后验更新剩下的预约价格。
去中心化版本叫 Pandora's Bidder。平台把其他 specialist 最好的 \(g\) 当标价,战略选手决定要不要付钱看自己的 \(g\),再决定接不接这单。信息价值在标价贴近自己均值时最高,对应一个闭区间,只有落在区间里才值得精炼。
主指标是路由后悔加 \(g\) 的检查成本,对检查单价 \(cg\) 扫描再取平均。后悔是选中真实回报相对事后最优 specialist 的缺口。
| 方法 | MATH 总代价 | RAG 总代价 | EmbedLLM 总代价 |
| f-only | 0.117 | 0.150 | 0.393 |
| g-only | 0.128 | 0.141 | 2.356 |
| Top-2 | 0.128 | 0.146 | 0.438 |
| Margin-\(N{pr}\) | 0.105 | 0.128 | 0.389 |
| Pandora's Router | 0.105 | 0.118 | 0.386 |
Pandora's Router 三套任务平均总代价都最低。它跟 Margin 花同一笔检查预算,但预算花在预约价格高的盒子上,RAG 上 0.118 对 Margin 的 0.128。MATH 只有两个候选,预算本身几乎决定后悔,两者打平。EmbedLLM 上 g-only 被一百多次检查拖到 2.356,Pandora 把平均检查成本压到 0.075,总代价 0.386。
\(cg\) 很低时几乎每盒都开,贴近 g-only;\(cg=0.1\) 时一次都不开,退回 f-only。中间段贴住两条基线的下沿。Bidder 侧,对手的 \(g\) 准时,按信息价值出价能把配置效率拉到静态基线的下沿;对手很噪时,战略选手会拒掉利润不够的单,自己盈余上去,整体配置效率下来。
线上路由真正烧钱的,经常是为了做决定而去检索、提前推理、跑打分器。这篇给了一个能算的停手规则:信息价值盖不住成本就别查。要落地,得先有标定集去估高斯均值和方差,不是即插即用的新产品。框架干净,改进是渐进的。
高斯假设抓不住重尾和多峰。附录换过非高斯拟合,路由成绩没有变好。估分器被收成 \(f\)、\(g\) 两档,真实系统往往是一串深度不同的工具。拍卖是单轮 leave-one-out,没对后续出价做战略预期。对手估分差的时候,局部最优会伤害全局福利。
Table 2 是对 \(cg\) 的平均。附录逐点看,不少档位相对 Margin 的优势在配对 bootstrap 下并不显著。MATH 域基本没有超出「少查两次还是零次」的信息。EmbedLLM 的相关修正是启发式 mean-field,没有给出近似比。