阿里南大提出TaoMate框架,解决数字人长视频生成误差累积
量子位 · wechat · 2026-08-02
阿里巴巴淘天集团与南京大学联合提出 TaoMate,一种面向少步联合音视频生成的锚点引导持久记忆框架,旨在解决数字人长视频生成中的递归误差累积与计算开销问题。
核心技术方案
- 记忆分离与锚点约束:将历史分为“有界活动上下文”与“固定容量持久记忆”,并使用不可变的视觉锚点约束动态状态更新,有效抑制色偏与外观漂移。
- 解耦检索与外观调制:通过残差侧注意力检索音视频历史,结合 Reference-AwareFiLM 机制进行通道级外观调制,保证长时一致性。
- 因果蒸馏与并行推理:采用混合 rollout 长度训练学生模型以适应累计误差;利用阶段并行推理,在3张GPU上实现了 35.0 FPS 的完整流水线输出。
实验结果
在长时评测基准中,TaoMate 的唇形同步(LipSync)与长时一致性(LongConsistency)均显著提升,且 DiT 吞吐量达到次优方案的 1.56 倍。团队还搭建了实时交互原型,支持流式生成与播放,验证了其在直播数字人等实时交互场景中的部署潜力。
「多模态」频道最新
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24
- MiniMax H3 本地生成 Pudgy Penguins 音乐视频 — cocktailpeanut · 2026-08-24
- Thrixel 一小时生成可玩 3D 森林与 BOSS — RanaHanocka · 2026-08-24
- 30 年动画人用 AI 赋予角色生命,作品 The Latent Stroke — Paferkas-71 · 2026-08-24
- 用 Minimax H3 制作风世界开场动画,含完整工作流 — Routine_Ad_3391 · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24