人大蚂蚁联合发文,扩散语言模型LLaDAMoEv2逼近Qwen3
机器之心 · wechat · 2026-08-11
中国人民大学高瓴人工智能学院与蚂蚁集团联合团队,首次系统刻画了混合专家扩散语言模型的扩展定律,并基于该定律从头训练了新一代30B-A3B模型 LLaDAMoEv2。
研究团队在超参数配置、算力分配与架构设计三个维度上总结了扩散模型专属的扩展规律。实验表明,LLaDAMoEv2激活约3B参数,仅用同规模自回归模型约65%的预训练词元,便在多项基准测试上逼近Qwen3水准。在代码与推理任务中,该模型仅经有监督微调便超越了现有领先的扩散模型,标志着扩散语言模型从“经验驱动”迈向“定律指引”的规模化时代。
「模型」频道最新
- UCL新研究用RL微调,解决大模型“撒谎”与隐瞒影响因子问题 — alex_verem · 2026-08-11
- Falcon-Perception:0.6B模型助力目标检测标注生成 — vanstriendaniel · 2026-08-11
- Claude 输出已加入隐形文本水印,引发用户移除探讨 — Franck_Dernoncourt · 2026-08-11
- 爆料称 9 月底迎大更新,下篇论文聚焦 Agent 与持续学习 — teortaxesTex · 2026-08-11
- Anthropic 将为所有 Claude 输出嵌入隐形水印 — The Decoder · 2026-08-11
- 爆料:DeepSeek V4 Pro 版本即将发布 — dejavucoder · 2026-08-11