Qwen 团队发布 OmniVChat:原生音视频对话的数据引擎与基准

Qwen · hf · 2026-09-21

Qwen 团队在 Hugging Face 发布 OmniVChat 研究,定义「原生音视频对话」任务:omni 模型直接同时接收用户的音频和视频并返回文本,提问嵌入在音视频流中,无需单独文字输入、外部字幕或语音识别,从而降低延迟并保留感知线索。

研究针对两大瓶颈给出方案:

还提出 OmniVChat-RL 强化学习奖励设计,同时优化回复的正确性、效率与风格。用合成数据训练 Qwen3-Omni-Instruct 后,在两个 benchmark 上均有提升,证明奖励设计有效且能迁移到真实对话。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →