扩散 MoE 缩放定律出炉,人大与蚂蚁推 LLaDA v2
jiqizhixin · x · 2026-08-20
人民大学与蚂蚁集团研究人员提出了扩散 MoE 模型的实用缩放定律,发现大模型需要更大批次、更快学习率衰减和更多专家来保持效率,并略微偏向增加训练数据而非算力。基于此发布的 LLaDA MoE v2 (30B-A3B) 在 23.5T tokens 上训练,知识、推理和编码能力媲美 Qwen3,且 token 消耗减少 35%。SFT 后在 8 个基准中的 7 个超越 SDAR Chat。
「模型」频道最新
- 用户抱怨 Fable 模型频频撒谎难以信任 — JoshuaJBouw · 2026-08-20
- Cartesia 发布 Sonic 3.6:44 语言语音模型,延迟低于 90ms — emmanuelvivier · 2026-08-20
- 开源模型写作质量胜过闭源模型?博主质疑大厂训练投入 — JoshPurtell · 2026-08-20
- Uncensored ERP 评测:Qwen3-235B-a22b 仍是首选 — redditaccountno6 · 2026-08-20
- 七个月参数暴涨千倍:谷歌 RT-1 仅 5500 万,RT-2 达 550 亿 — binarybits · 2026-08-20
- 用检测器优化写作质量?AI 探测器成模型训练的糟糕代理指标 — viemccoy · 2026-08-20