人大蚂蚁联合发文,扩散语言模型LLaDAMoEv2逼近Qwen3

机器之心 · wechat · 2026-08-11

中国人民大学高瓴人工智能学院与蚂蚁集团联合团队,首次系统刻画了混合专家扩散语言模型的扩展定律,并基于该定律从头训练了新一代30B-A3B模型 LLaDAMoEv2。

研究团队在超参数配置、算力分配与架构设计三个维度上总结了扩散模型专属的扩展规律。实验表明,LLaDAMoEv2激活约3B参数,仅用同规模自回归模型约65%的预训练词元,便在多项基准测试上逼近Qwen3水准。在代码与推理任务中,该模型仅经有监督微调便超越了现有领先的扩散模型,标志着扩散语言模型从“经验驱动”迈向“定律指引”的规模化时代。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →