扩散 MoE 缩放定律出炉,人大与蚂蚁推 LLaDA v2

jiqizhixin · x · 2026-08-20

人民大学与蚂蚁集团研究人员提出了扩散 MoE 模型的实用缩放定律,发现大模型需要更大批次、更快学习率衰减和更多专家来保持效率,并略微偏向增加训练数据而非算力。基于此发布的 LLaDA MoE v2 (30B-A3B) 在 23.5T tokens 上训练,知识、推理和编码能力媲美 Qwen3,且 token 消耗减少 35%。SFT 后在 8 个基准中的 7 个超越 SDAR Chat。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →