Salt++:两阶段后训练让 4 步流式音视频生成质量最高提升 57%

Xingtong Ge · hf · 2026-10-08

少步流式音视频生成需要同时做因果建模和步数蒸馏,但标准训练方法存在两个上下文相关难题:teacher forcing 用干净历史配噪声目标,只能通过速度预测间接监督上下文表征;把双向 score 模型直接用于因果 DMD 会造成生成与打分上下文不匹配。

Salt++ 提出两阶段后训练框架解决这些问题:

效果:480p 下同等 4 步因果设定,JavisBench 视觉与运动质量比 OmniForcing 分别提升 57% 和 45%;额外的 scale-wise 后训练阶段扩展到 4 步 1664×960 生成,7 项指标中 6 项超过双向 LTX-2。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →