E-MoE 用专家路由作共享隐变量,改进少步扩散语言模型生成
Arseny Ivanov · hf · 2026-10-02
掩码扩散模型(MDM)的反向过程通常在各位置上因子化,限制了少步生成质量。已有的连续高斯隐变量方案依赖 VAE,易出现后验坍缩——隐变量被静默忽略。
提出的 E-MoE 把反向过程构建为 MoE 骨干专家路由决策所定义的离散共享隐变量上的混合分布,不增加相对因子化基线的激活参数量。在合成多模态基准、二值化 MNIST 与 LM1B 上,E-MoE 提升了少步生成质量。
「研究」频道最新
- 决策模型受捧遭泼冷水:缺证据链让企业客户难买单 — joecole · 2026-10-02
- 中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别 — ustc · 2026-10-02
- NEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0% — locailabs · 2026-10-02
- Latent-Foresight 端到端学习可预测表征,世界模型一致超越两阶段基线 — Efstathios Karypidis · 2026-10-02
- Technion 研究:泛化是稳定性而非准确率,跨数据集可逆转模型排名 — Technion · 2026-10-02
- David Stutz:通用知识加专用模型路线将主导 AI for Science — davidstutz92 · 2026-10-02