仅用 65% 训练量比肩 Qwen3,扩散语言模型 LLaDA MoE v2 发布
GSAI-ML · hf · 2026-08-05
本文系统研究了混合专家扩散语言模型的缩放行为,发现了其与自回归(AR)模型的显著差异:最优批次大小增长更快,而学习率衰减更迅速;在计算分配上略微偏向数据侧。
基于这些规律,团队从头训练了总参数量 30B、激活参数 3B 的 LLaDA MoE v2。该模型仅使用约 23.5T tokens(相当于 Qwen3 预训练量的 65%),在多项知识与推理基准上便逼近了 Qwen3 的表现,并在仅经过 SFT 后于 8 项推理与编程测试中的 7 项超越了 SDAR Chat。
「研究」频道最新
- SDXL 模型 NVFP4 量化实测:HSWQ 方案显著优于原生量化 — Zestyclose_Bake3680 · 2026-08-05
- 开发者用单张 H100 训练 2 小时打造 203M 葡语模型 — War_Enterprise · 2026-08-05
- NeurIPS 审稿机制引热议:作者呼吁审稿人明确评分弹性 — miniapeur · 2026-08-05
- 长提示词反损画质?论文揭示文生图文本控制新解法 — rohanpaul_ai · 2026-08-05
- 研究:微调仅需篡改 0.5% 数据即可植入大模型后门 — connoraxiotes · 2026-08-05
- 康奈尔研究:最新 LLM 拒绝盲目附和,不再讨好用户 — i_dg23 · 2026-08-05