Scaling laws for diffusion MoE released; LLaDA v2 rivals Qwen3 with 35% fewer tokens

jiqizhixin · x · 2026-08-20

Researchers from Renmin University and Ant Group introduced practical scaling laws for diffusion MoE, showing that larger models require bigger batches, faster LR decay, and more experts. They released LLaDA MoE v2 (30B-A3B), trained on 23.5T tokens, which rivals Qwen3 on knowledge, reasoning, and coding while using 35% fewer tokens. After SFT, it beats SDAR Chat on 7 out of 8 benchmarks.

Original post →

More from Models

Models channel →