港中文阿里团队提出 OmniVChat:合成数据训出原生音视频对话能力
机器之心 · wechat · 2026-09-28
香港中文大学、Alibaba TokenHub、上海交大等团队发布 OmniVChat,定义并攻克「原生音视频对话」:模型直接同时接收用户音频和视频,无需文本问题、字幕或语音转写,能结合语气、表情、镜头朝向理解处境。
针对真实音视频对话数据稀缺、评判标准缺失两大难题,团队提出「为了理解而生成」路线,构建三件套:多智能体数据引擎 OmniVChat-Studio(Director/Renderer/Reviewer/Validator 四个智能体合成带参考回复和分层评分标准的单轮与多轮对话)、2800 条评测基准 OmniVChat-Bench(覆盖连接感知、实体对齐、自我认知、反幻觉、情绪识别五大类 17 子类)、以及把评分标准直接变成奖励的强化学习方案 OmniVChat-RL。
基座为 Qwen3-Omni-30B-A3B-Instruct。关键结论:仅用合成数据做强化学习,模型在 OmniVChat-Bench 上从 0.465 升至 0.652,在完全未参与训练的真人录制集上也从 0.402 升至 0.632,证明合成训练可高度泛化到真实交互场景。论文、数据集与代码均已开源。
「研究」频道最新
- RECLAIM 预印本:最佳 AI agent 仅复现 41% 有代码论文结果 — VraserX · 2026-09-29
- 扩散薛定谔桥论文:迭代扩散求解熵正则最优传输加速生成建模 — skoularidou · 2026-09-29
- NeurIPS 论文揭秘蛋白质折叠模型:三模型收敛出相同两阶段机制 — rishabh16_ · 2026-09-29
- 斯坦福新课 CME 295 回归:Lecture 1 已上线 YouTube — afshinea · 2026-09-29
- Astra 通关 Zork 靠作弊?博主分析:像背攻略而非真探索 — rajammanabrolu · 2026-09-29
- USC 论文:九种 LLM 数字嵌入均现周期 2/5/10 傅里叶尖峰 — BrihiJ · 2026-09-29