阿里开源 TaoMate-H3:三步流式音视频联合生成,首段提速 27 倍
机器之心 · wechat · 2026-10-02
阿里巴巴 TaoLive AIGC 团队发布并开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可根据文本连续生成含人物对白、歌声和环境音的视频,支持分钟级续写和 480p/768p/1080p 横竖屏输出。
关键技术包括:三步 LoRA 压缩每片段去噪开销、SelfForcing 自回归训练缓解分布差异、滚动更新的音视频 KV 缓存维持长视频一致性、连续 RoPE 时间编码改善跨提示词衔接、音频轨迹引导稳定台词节奏。在 8×H20 上测试,相比原版 MiniMax H3,纯 DiT 计算耗时由 169.57 秒降至 14.81 秒(加速 11.45 倍),首段 latent 就绪时间由 170 秒缩短至 6.15 秒(加速 27.66 倍)。
演示覆盖电商讲解、人物演唱、动漫对白、环境特效等场景,推理代码与 LoRA 权重已在 GitHub 和 Hugging Face 开放。
「Infra」频道最新
- 5090+5070Ti 双卡实测:显存翻倍不如想象中值 — Lordofwhut · 2026-10-02
- 6 张 AMD 矿卡集群跑本地 LLM:100k 上下文 28 tok/s — Ok-Breadfruit-3523 · 2026-10-02
- 8GB 显存跑视频生成:MiniMax H3 配 360 orbit LoRA 实测 — big-boss_97 · 2026-10-02
- NVIDIA 应用深度学习 VP:算力见顶,效率就是新智能 — ctnzr · 2026-10-02
- IBM Torch Spyre 团队用 Agent 流水线守住 PyTorch 上游兼容 — lmoroney · 2026-10-02
- ModelHarbor:开源可自托管的模型库项目 — toks-love · 2026-10-02