Meta 揭秘 Muse 流式架构:语音与视频化身共享 speech token 流实现实时同步
AIatMeta · x · 2026-09-24
Meta 官方介绍 Muse Realtime Voice 与 Muse Realtime Avatar 构成的统一流式架构:通过共享的 speech token 流连接对话智能、语音与视频化身。Muse Realtime Voice 生成同时编码内容与韵律的语音 token;Avatar 消费同一 token 流生成同步视频。系统以固定长度历史作为后续视频块的运动上下文,使任意对话时长下计算量有界,实现语音、口型与表情的同步生成。
所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→
「多模态」频道最新
- Opus 5.5 二十分钟纯代码产出动画配乐配音的启动视频 — cedric_chee · 2026-09-26
- 空歌词喂给音乐模型 YuE 2,竟唱出一堆听不懂的歌词 — SteveLittleFish · 2026-09-26
- 网传「Opus 5.5」出人意料,用户称生成视频几乎零成本零努力 — chaumian · 2026-09-26
- 「视频模型越来越强了」:Reddit 用户分享惊艳生成视频 — we_are_mammals · 2026-09-26
- VLM 网关用 Gemma 从像素直接玩贪吃蛇,端到端延迟低于 240ms — spillai · 2026-09-26
- 用 Opus 编排 Krea MCP 与 Hyperframes,自动导演阿雷西博信息科幻短片 — angrypenguinPNG · 2026-09-26