首个 3B/8B 规模连续扩散语言模型:低步数推理质量保持更优
ArashVahdat · x · 2026-10-06
Morteza Mardani 团队(转发者含 NVIDIA 研究员 Arash Vahdat)发布首个大规模(3B/8B)连续扩散语言模型工作。
核心结果:
- 利用平滑连续轨迹(smooth continuous trajectories)训练,pass@1 与掩码扩散语言模型(dLM)相当,pass@k 推理更优
- 在低 NFE(函数评估次数)下质量衰减更平缓
- 被视为迈向单步/少步解码和大规模高效 RL 后训练的重要一步
所属事件:NVIDIA 团队发布首个大规模连续扩散语言模型 Sigma(3 条相关)→
「模型」频道最新
- 博主质疑新模型与 PrismML 尺度一致,疑用其内核却未署名 — _xjdr · 2026-10-06
- 3500 美元 Blackwell 个人 AI 主机实测:RTX PRO 4000 跑 Qwen Next 达 50-70 tok/s — Jackyhuang · 2026-10-06
- 网友实测 MiniMax H3:「真的不可思议」 — CompleteBed1797 · 2026-10-06
- Reddit 用户抱怨 Claude Opus 突然大面积拒绝正常创作请求 — astrorocks · 2026-10-06
- 花 3 万买 RTX 5060 跑本地 LLM,实测复杂任务被云模型碾压 — Tricky-Brother-7 · 2026-10-06
- Full-bandwidth Transformer 论文更新:潜反馈通道提升 1B 模型效率 — _arohan_ · 2026-10-06