Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
Haoyu Zhang, Zhipeng Li, Xiaoying Tang, Tianshu Yu, Yiwen Guo
cs.AI, cs.CL, cs.CV
2026-08-11
Ex-Omni-2D 让全能对话模型在回复文本和个性化语音之外,再生成一段由参考形象驱动的数字人视频。它先用结构化的视觉思维计划(VTP)把对话上下文翻译成场景、情绪、动作意图,再用一套共享的多码本语音单元同时驱动语音合成和视频帧对齐;4 步推理的四卡流水线端到端 RTF 1.293。
全能对话模型能听懂语音、文字、图像,并用语音回答,但回答是「看不见脸」的,只有声音没有视觉形象。已有的语音驱动数字人(audio-driven avatar)通常要靠一段额外写好的文字 prompt 来控制场景、情绪、动作,在对话里手动设计这段 prompt 既不灵活,又容易和当前对话状态脱节。直接把 LLM 的高维隐状态映射进视频生成器又太贵、太绑定具体模型,而且「问题、文本、语音、视频」四元对齐的大规模数据根本拿不到。作者要解决的是:在缺大规模对话-视频配对数据的前提下,让一次对话回复同时产出文本、个性化语音、和形象一致的视频。
Ex-Omni-2D 的核心是把对话模型和视频生成器解耦,中间架两个共享接口。
第一个是视觉思维计划(Visual Thought Plan,VTP)。对话主干(Qwen3-8B)在被约束的 <thinking> 块里先吐出一个结构化的五字段计划:首帧场景、整体场景、情绪、动作风格、动作细节,再去生成用户可见的回复文本。VTP 是一段可检查的文本中间表示,不是一段不受约束的思维链,也不是不透明的高维隐状态映射。它把「回复应该长什么样」的高级意图显式化。
第二个是原生多码本语音单元。语音生成器(基于 Qwen3-TTS-0.6B)预测 16 个码本的声学单元序列,这套单元同时被解码成语音波形,又被对齐到视频帧(语音 12.5Hz、视频 25fps,一组单元对齐两帧)作为驱动数字人动作的条件。这样一来,语音和视频这两条本来需要不同数据训练的路径,可以分别用语音数据、对话数据、形象视频数据来监督,再在推理时用 VTP 和生成的语音单元把它们重新接上,绕开了对四元配对数据的需求。
视频生成器有两个版本。全序列教师模型(基于 Wan2.1-T2V-1.3B + OmniAvatar 权重)质量最高但太慢,做主输出。为了能增量部署,作者把它蒸馏成一个分块因果的流式学生模型,并提出 Prefix Streaming:把上一块的干净隐状态直接放进当前去噪窗口里当锚点,stop-gradient 和去重缓存防止它被重新生成。这专门对付流式生成里「越往后越走样」的累积退化。
在 VoiceBench/CommonEval 的 200 条语音问答上做音视频评测。Ex-Omni-2D 教师模型在生成对话回复、个性化语音、视觉计划的同时,拿到 SIM 0.417、Sync-C 4.95;它不在单项渲染指标上称王(echomimic 的主体一致性 SC 97.87 最高,OmniAvatar 的 Sync-C 5.64 最高),但那些基线只做渲染、不做对话。
质量与效率的权衡很清楚:
| 模型 | 去噪步 | SC | IQ | DD | Sync-C | E2E RTF |
| 教师 | 50 | 94.62 | 67.31 | 72.00 | 4.95 | 26.917 |
| 学生 | 4 | 93.65 | 57.40 | 32.00 | 3.90 | 1.293 |
| 学生 | 8 | 93.91 | 61.15 | 48.00 | 4.00 | 1.932 |
四步学生模型在 400×720 下端到端 RTF 1.293(小于 1 即快于实时,但这是增量输出而非端到端实时交互),首段可播放视频块在 3.14 秒后产出。语音问答上 AlpacaEval 4.28、CommonEval 3.71、BBH 58.70,在已列系统里仅次于 Qwen2.5-Omni。多轮对话(OmniCharacter)上流畅、连贯、一致性三项均值 3.938,高于其 Qwen3-8B 主干的 3.537。
Prefix Streaming 的消融:16 块 DINO 分析里,末块减首块的一致性误差从 0.1005 降到 0.0790,降了 21.4%,且从第 9 块起每块都稳定更好。
这篇给「全能对话模型」补上了缺失的视觉形象这一环,而且走的是工程上可落地的路线:用两个轻量、可检查的文本和码本接口,把本就要分别训练的语音和视频路径接起来,回避了昂贵的四元配对数据。Prefix Streaming 把流式视频生成的累积退化压住,给了交互部署一个可用的质量与效率档。对做数字人、虚拟陪伴、实时交互语音助手的团队,这是一条可参考的解耦架构。
作者承认几条。一是语音和参考说话人的相似度还有提升空间。二是 VTP 只是高级语义引导,不是独立充分的视频控制信号,最终画面由 VTP 和帧对齐语音单元共同决定,固定的文本与音频 CFG 比例不一定对所有回复都合适。三是在共享自回归通道里生成 VTP 会带来可测量的语音问答和推理能力损失。四是长程分析只覆盖了主体时间稳定性和面部动作规律性。五是教师模型仍很贵(双向时间上下文加大去噪预算),学生模型快但 IQ、DD、Sync-C 都低于教师,首块视频要 3.14 秒、单请求 E2E RTF 仍大于 1,所以它是增量输出而非端到端实时交互。需要留意的一点:论文的对比是「不同接口各自的最佳能力」展示,不是同接口架构的严格排名。