TurboT2VA 三阶段蒸馏:19B 音视频模型 4 步生成提速 54.67 倍

青稞AI · wechat · 2026-09-25

清华团队提出 TurboT2VA,针对 19B 参数的开源音视频联合生成模型 LTX-2 做加速:训练端将 40 步教师蒸馏为 4 步学生,采用「离散一致性蒸馏 warmup → 连续一致性蒸馏细化 → sCM+DMD 联合优化」的三阶段课程,先用轨迹学习确定联合生成结构,再引入分布匹配改善感知质量;音视频两模态分别设置时间步 shift 与损失归一化。推理端叠加 W8A8 量化、SageSLA 稀疏注意力、文本填充压缩与算子融合。

结果是:1024×1792、121 帧设置下,单张 H20 上的生成器耗时从 318.74 秒降至 5.83 秒,加速 54.67 倍;且音画对齐指标不降反升。论文已公开,代码在 GitHub thu-ml/TurboDiffusion 仓库。

所属事件:TurboT2VA 三阶段蒸馏让 LTX-2 音视频生成提速 54.67 倍(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →