研究发现超稀疏 MoE 存在“静默专家死亡”现象
YouJiacheng · x · 2026-08-26
一篇新博客文章揭示了超稀疏混合专家模型中一个未被察觉的失败模式。
- 现象:在训练极稀疏的 MoE(如 top-8/768)时,底层的专家可能在训练/验证损失和负载均衡看起来完全正常的情况下,变得功能失效。这些层的专家权重范数远小于健康层。
- 普遍性:审计公开的 MoE 模型(如 MiMo-v2.5-Pro 和 Qwen3.5-397B-A17B)也发现了类似的早期层崩溃迹象,基准测试可能掩盖了未被使用的容量。
- 原因:这不仅仅是负载均衡的失败,研究发现学习信号本身消失了。
- 解决方案:文章提到将损失函数连接到早期层可以在大规模上解决这一问题。
「研究」频道最新
- SAP 十亿美元收购 Prior Labs,TabPFN 主创访谈 — ziv_ravid · 2026-08-26
- 大英百科全书 1768-1929 年 11.5 万页插图数据集开源 — vanstriendaniel · 2026-08-26
- 研究:GLM 5.2 在不同 API 提供商处性能表现惊人一致 — niloofar_mire · 2026-08-26
- Anthropic 研究员将开讲:Claude 的 J 空间与机器意识 — PeterBowdenLive · 2026-08-26
- 研究称 Agent 框架对分数影响大于模型本身 — rohanpaul_ai · 2026-08-26
- NeurIPS 2026 设「可解释性作为科学」研讨会,探讨 LLM 理解的严格基础 — ninamiolane · 2026-08-26