免训练改路由:Qwen 35B 推理 token 减少 8.5%,延迟降 10.9%

Specific-Tax-6700 · reddit · 2026-09-04

作者发布新论文,提出一种纯推理时的 MoE 路由优化:不训练不微调,仅在 transformer 后期层扩大专家选择预算(Qwen3.6-35B-A3B 变为 A4B+),并对额外专家施加线性衰减。- 在 MMLU-Pro 全量 714 题上,平均推理 token 减少 8.5%,延迟下降 10.9%(p=6.5×10⁻⁶)- 准确率不变(84.5% vs 84.0%,统计不可区分)- 现象被称为「Succinct Convergence」:给决策关键的末层更多专家容量后,模型用更短的推理轨迹得到同样正确的答案- 论文与 beta 代码、完整 benchmark JSON 结果已在 Zenodo 和 GitHub 公开,作者希望未来在更大模型上复现

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →