Meta 揭秘 Muse 流式架构:语音与视频化身共享 speech token 流实现实时同步

AIatMeta · x · 2026-09-24

Meta 官方介绍 Muse Realtime Voice 与 Muse Realtime Avatar 构成的统一流式架构:通过共享的 speech token 流连接对话智能、语音与视频化身。Muse Realtime Voice 生成同时编码内容与韵律的语音 token;Avatar 消费同一 token 流生成同步视频。系统以固定长度历史作为后续视频块的运动上下文,使任意对话时长下计算量有界,实现语音、口型与表情的同步生成。

所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →