免训练改路由:Qwen 35B 推理 token 减少 8.5%,延迟降 10.9%
Specific-Tax-6700 · reddit · 2026-09-04
作者发布新论文,提出一种纯推理时的 MoE 路由优化:不训练不微调,仅在 transformer 后期层扩大专家选择预算(Qwen3.6-35B-A3B 变为 A4B+),并对额外专家施加线性衰减。- 在 MMLU-Pro 全量 714 题上,平均推理 token 减少 8.5%,延迟下降 10.9%(p=6.5×10⁻⁶)- 准确率不变(84.5% vs 84.0%,统计不可区分)- 现象被称为「Succinct Convergence」:给决策关键的末层更多专家容量后,模型用更短的推理轨迹得到同样正确的答案- 论文与 beta 代码、完整 benchmark JSON 结果已在 Zenodo 和 GitHub 公开,作者希望未来在更大模型上复现
「研究」频道最新
- AI 从头设计抗体在体内中和眼镜蛇神经毒素获验证 — BrianHie · 2026-09-04
- 罗马望远镜视野达哈勃百倍,首年将编目10亿星系 — PeterDiamandis · 2026-09-04
- 几何 Jensen-Shannon 散度的两种诠释:可视为 JSD 的正则化形式 — FrnkNlsn · 2026-09-04
- Eric Topol 发文 Lancet:AI 大健康模型可提前数年预测疾病 — EricTopol · 2026-09-04
- OpenCLIP 新增 ModernText 原生编码器,可定制性优于 Transformers 版 ModernBERT — wightmanr · 2026-09-04
- JHU 研究:LLM 难以忽略训练期旧知,新上下文常被训练记忆覆盖 — mdredze · 2026-09-04