Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo
cs.SD, cs.CV, eess.AS
2026-08-29
Motion-Omni 让对话模型从生成语音的隐状态直接输出脸、手、上身和下身动作。同一音频下参考无关指标对齐 LOM 教师级联到 2% 以内,响应快 5.4 倍(RTF=0.78),omni 模型里 WER 最低为 2.62%。
能对话的数字人要同时决定说什么、说话时身体怎么动。这两件事目前分属两族模型:spoken dialogue model 只出语音,co-speech motion 模型只根据已经生成好的音频出动作。产品上的默认接法是级联:先跑完对话模型,再把成品音频喂给动作模型。这要多走一整段推理,而且动作损失永远回不到对话通路上。
已有工作放松了这条配方。SOLAMI 会出语音和身体,脸部仍靠后处理;Ex-Omni 联合优化了 52 维 ARKit 脸,但只管脸;ViBES 和 MIBURI 把语音专家冻住,动作梯度进不去。Motion-Omni 要验证的是:开放式对话模型能不能原生吐出脸、手、上身、下身,并且让动作目标回写 LLM 和独立的 Speech Generator。
参考实例 Motion-Omni-Q7 有四块。冻结的 Whisper-large-v3 做语音编码,经五帧拼接加两层 MLP 投进 LLM;骨干是 Qwen2.5-7B-Instruct;Speech Generator 从 Qwen2.5-0.5B-Instruct 初始化,以 12.5 Hz 吐 GLM-4-Voice 离散单元(词表 16,384);四个并行的部位解码器以 30 Hz 吐 LOM 的 VQ 码,分别对应脸、手、上身、下身,再由冻结的 LOM VQ-VAE 解成 SMPL-X 和 FLAME。
动作头不看波形。它把 Speech Generator 最后一层隐状态当 key/value,把刚发出的语音 token 嵌入从 12.5 Hz 线性插值到 30 Hz 当 query。动作直接从「正在生成这句话」的表征里长出来。四个部位共享这份语音上下文,彼此不对对方已采样的码做交叉条件。损失按部位加权,权重 106:180:78:61,和底层特征维度成正比。
联合更新不是可选项。试点里冻住语音通路,动作损失停在更高的平台,渲染出来的动作和音频对不齐。训练因此拆成四段:Stage 1 只训 speech projector 做 ASR;Stage 2 冻 LLM,训 Speech Generator 做 TTS;Stage 3 挂上 Motion Generator,按质量分位数 12.5%/25%/50%/100% 的课程表和 Speech Generator 一起训,教师参考 FGD 从 0.3974 降到 0.3040;Stage 4 解冻 LLM,混 ASR、TTS、语音到语音加动作、以及纯文本对话。
监督来自可替换的教师伪标注。LOM 给 InstructS2S-200K 里音色一致的回复打动作标签,再按 VQ 重建误差和 beat correlation 打分,得到 422,856 对、1,402 小时。直接拿未排序全集训会发散,所以才有那段分位数课程。Stage 4 另混约 21.3 万条纯文本,否则模型更容易复读用户输入。
评测集是新放的 SwDA-500:从 Switchboard 对话行为语料抽出 500 条开放式提示,覆盖 66 个话题。动作对比都在匹配音频上做,避免「说了什么」干扰「怎么动」。BC、FGD 按 ×10⁻¹ 报告。
| 系统 | BC↑ | Diversity↑ | RTF↓ | 唇同步 LSE-C↑ |
| Motion-Omni-Q7 | 7.59 | 13.67 | 0.78 | 7.011 |
| 同音频 + LOM 教师级联 | 7.67 | 13.07 | 4.39 | 6.985 |
| 同音频 + EMAGE | 7.32 | 10.95 | 0.84 | 6.643 |
| Qwen2.5-Omni + LOM | 7.56 | 13.82 | 18.34 | 7.136 |
在不调用 LOM 做推理的系统里,Motion-Omni-Q7 的 beat correlation 和 diversity 最高,唇同步也优于 EMAGE 和 MambaTalk 级联。相对同音频教师级联,参考无关指标差在 2% 以内;整段语音加动作 4.32 秒出完,快 5.4 倍。教师参考 FGD 为 3.03,非 LOM 推理系统里最低。
对话能力没有被动作头拆掉。VoiceBench 总分 47.63,高于 LLaMA-Omni 的 41.12 和 Ex-Omni 的 43.57。Seed-TTS-Eval 英文 WER 2.62%,omni 模态里最低,仍高于专精 TTS(Qwen3-TTS-12Hz-1.7B 为 1.24%)。
四人小规模人评,每臂 25 对、三项(节奏、语义、自然度)合计:对同音频 EMAGE 净胜 +25(45 胜/10 平/20 负);对教师 LOM 是 25/27/23,平局最多。论文自己把小样本标成 exploratory,不读成稳定偏好。
数字人如果还在「先出音频再跑动作」,这篇给了一条可复现的替代:动作头挂在语音生成器的隐状态上,省掉第二次完整推理,还把对齐做成联合目标。教师和组件都可换,代码与伪标注数据已公开。对要上线对话数字人的团队,这更接近一个模型同时说话和比划,而不是两条流水线对表。
质量天花板仍是 LOM 教师,评测参考分布也是 LOM 自己画的。它证明的是:在教师分布附近,端到端可以追上级联并砍掉延迟。
动作表达被 LOM 的 VQ 码本和伪标签卡住,码本外的动作出不来;只训了 Q7 这一档;没有说话人身份和情绪条件;数据全是英文。系统吃完整段用户语音才开始吐第一个 token,是离线回复生成器,不是 MIBURI 那种流式交互。
FGD 用 LOM 在同一音频上的预测当参考,天然偏向长得像老师的系统。人评四人、每臂 25 对。视频 LLM-as-judge 只在语音质量上和人对得上,感知结论还是靠人。SwDA-500 不是配对真实动作基准,开放式对话的「动作对不对」仍然没有真人 motion capture 真源。