阿里开源 TaoMate-H3:三步流式音视频联合生成,首段提速 27 倍

机器之心 · wechat · 2026-10-02

阿里巴巴 TaoLive AIGC 团队发布并开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可根据文本连续生成含人物对白、歌声和环境音的视频,支持分钟级续写和 480p/768p/1080p 横竖屏输出。

关键技术包括:三步 LoRA 压缩每片段去噪开销、SelfForcing 自回归训练缓解分布差异、滚动更新的音视频 KV 缓存维持长视频一致性、连续 RoPE 时间编码改善跨提示词衔接、音频轨迹引导稳定台词节奏。在 8×H20 上测试,相比原版 MiniMax H3,纯 DiT 计算耗时由 169.57 秒降至 14.81 秒(加速 11.45 倍),首段 latent 就绪时间由 170 秒缩短至 6.15 秒(加速 27.66 倍)。

演示覆盖电商讲解、人物演唱、动漫对白、环境特效等场景,推理代码与 LoRA 权重已在 GitHub 和 Hugging Face 开放。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →