Salt++:两阶段后训练让 4 步流式音视频生成质量最高提升 57%
Xingtong Ge · hf · 2026-10-08
少步流式音视频生成需要同时做因果建模和步数蒸馏,但标准训练方法存在两个上下文相关难题:teacher forcing 用干净历史配噪声目标,只能通过速度预测间接监督上下文表征;把双向 score 模型直接用于因果 DMD 会造成生成与打分上下文不匹配。
Salt++ 提出两阶段后训练框架解决这些问题:
- Causal Self-Flow (CSF):固定噪声目标、变化历史,让噪声混合历史的学生对齐干净历史的 EMA 教师的中间表征,自监督地促进语义提取与跨模态对齐;
- 上下文对齐的自回归 DMD:在生成采样、fake-score 训练和 real-score 评估间共享因果 mask 和前缀,以 block-conditional KL 目标匹配分布,先做干净前缀蒸馏再适应生成历史。
效果:480p 下同等 4 步因果设定,JavisBench 视觉与运动质量比 OmniForcing 分别提升 57% 和 45%;额外的 scale-wise 后训练阶段扩展到 4 步 1664×960 生成,7 项指标中 6 项超过双向 LTX-2。
「多模态」频道最新
- H3 motion-context 退化再起,作者开源低层修复工作流求共建 — xyzdist · 2026-10-08
- Kroma 0.3.1 实测:用户称提示词遵循与细节超越 Qwen 2.1 — Dear-Spend-2865 · 2026-10-08
- SheetSage2 用合成监督实现连贯乐谱转录,15 项指标中 12 项领先 — m-a-p · 2026-10-08
- Marigold V2 重审扩散 Transformer,深度估计 AbsRel 提升 16-26% — Cohere_Labs · 2026-10-08
- Qwen 2.1 图像实测:一键生成多角度角色设定图,风格偏国漫 — Gkashhh · 2026-10-08
- 谷歌 Flow 里可免费生成 Nano Banana 2.1 图像 — aziz4ai · 2026-10-08