NVIDIA 团队发布首个大规模连续扩散语言模型 Sigma
NVIDIA 夏季实习生 Wei Guo 及 Morteza Mardani 团队发布 Sigma,首个 3B/8B 规模的连续扩散语言模型(dLM),以似然目标训练。该模型利用平滑连续轨迹,在低步数推理下仍保持较优质量,在数学与编码任务上成绩可与离散扩散语言模型乃至自回归模型相媲美,被视为扩散语言模型技术路线的重要进展。
2026-10-05 ~ 2026-10-06 · 3 条相关
- 首个大规模连续扩散语言模型 Sigma 发布,3B/8B 媲美自回归 — LucaAmb · 2026-10-05
- 首个 3B/8B 规模连续扩散语言模型:低步数推理质量保持更优 — ArashVahdat · 2026-10-06
另有 1 条近重复转述:ArashVahdat