仅用 65% 训练量比肩 Qwen3,扩散语言模型 LLaDA MoE v2 发布

GSAI-ML · hf · 2026-08-05

本文系统研究了混合专家扩散语言模型的缩放行为,发现了其与自回归(AR)模型的显著差异:最优批次大小增长更快,而学习率衰减更迅速;在计算分配上略微偏向数据侧。

基于这些规律,团队从头训练了总参数量 30B、激活参数 3B 的 LLaDA MoE v2。该模型仅使用约 23.5T tokens(相当于 Qwen3 预训练量的 65%),在多项知识与推理基准上便逼近了 Qwen3 的表现,并在仅经过 SFT 后于 8 项推理与编程测试中的 7 项超越了 SDAR Chat。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →