Qwen 团队发布 OmniVChat:原生音视频对话的数据引擎与基准
Qwen · hf · 2026-09-21
Qwen 团队在 Hugging Face 发布 OmniVChat 研究,定义「原生音视频对话」任务:omni 模型直接同时接收用户的音频和视频并返回文本,提问嵌入在音视频流中,无需单独文字输入、外部字幕或语音识别,从而降低延迟并保留感知线索。
研究针对两大瓶颈给出方案:
- 数据稀缺:真实设备使用录音稀少,推出 OmniVChat-Studio 多智能体数据引擎,合成单轮与多轮音视频对话;
- 评估困难:好的回复需结合用户环境、表情、周围物体,且表达方式多样,关键词匹配不可靠。据此构建 OmniVChat-Bench,覆盖五大能力类别;另有人工录音的 OmniVChat-Bench-Human 用于验证。
还提出 OmniVChat-RL 强化学习奖励设计,同时优化回复的正确性、效率与风格。用合成数据训练 Qwen3-Omni-Instruct 后,在两个 benchmark 上均有提升,证明奖励设计有效且能迁移到真实对话。
「多模态」频道最新
- Pexo 推出 AI 视频 agent:像评论文档一样改视频 — CurieuxExplorer · 2026-09-22
- Reddit 导演求助:视频换背景后如何让演员光照匹配新场景 — ItsLukeHill · 2026-09-22
- GAE 发布:在几何原生潜空间直接生成视频与 3D 点云 — yshan2u · 2026-09-22
- 社区讨论:Qwen Image 2.1 能否像 H3 一样接上 refmods 工作流 — CranberryBeautiful76 · 2026-09-22
- Anima 模型缺 Detailer:风格 LoRA 下眼睛细节经常崩 — Kirisaki-Asako · 2026-09-22
- ElevenLabs 发布 Studio 4.0:AI 原生视频编辑器大升级 — nikola_mr64990 · 2026-09-22