SaveRouter论文:LLM路由只用四成监督数据即可回本
SinapisAI · hf · 2026-09-30
发表于 Hugging Face 的论文 SaveRouter 研究 LLM 路由的成本经济学问题:训练路由器通常需要先在历史查询上跑多个候选模型来收集质量反馈,这笔前置监督成本常被忽视,且路由质量往往在收集完全部反馈之前就已饱和。
SaveRouter 采用稀疏监督框架:选择性获取有信息量的模型反馈,并在相关查询间共享能力信息,同时保留查询级细化。在四个路由基准上:
- 仅用约 33–41% 的可用训练反馈即可保持相当或更优的路由质量
- 相比最快的传统路由器,盈亏平衡部署量降低约 1.9–9.5 倍
- 进一步分析表明,更多监督并不总是更经济:最小化服务成本与最早回本所需的最优监督水平可能不同
代码已开源(LAMDA-Model-Reuse/SaveRouter)。
「Infra」频道最新
- 双 R9700 本地推理:PCIe Gen4 比 Gen5 损失多大? — IngwiePhoenix · 2026-09-30
- 投机解码新招 SwitchSD 入选 NeurIPS:用隐藏状态决定何时直接抄上下文 — arankomatsuzaki · 2026-09-30
- 韩国 Rebellions NPU 获 ai& 大单:单芯片 2048 TFLOPS、144GB HBM3e — DavidBennett__ · 2026-09-30
- 个人 Rust+Vulkan 训练后端两周进展:14 个架构对齐验证,PEFT 完整可用 — PhysicsDisastrous462 · 2026-09-30
- 自建模型预测美光季度营收 562 亿美元,高出官方指引 12% — tengyanAI · 2026-09-30
- DeepSeek 为华为昇腾芯片开源 TileLang,绕开 CUDA 生态 — The Decoder · 2026-09-30