OmniReasoning:音视频联合推理基准,较 Qwen3-Omni 提升 12.8 点

_akhaliq · x · 2026-10-07

新工作 OmniReasoning 指出现有全模态模型的基准与训练方法大多把音频和视觉分开处理,音视频联合推理能力被低估且未被充分激发,并提出基准+数据+方法三件套:

模型 OmniReasoning-30B-A3B 在 OmniVideoBench 达 50.0%、OmniReasoningBench 达 42.5%,比基座 Qwen3-Omni-30B-A3B-Thinking 分别提升 12.8 和 9.3 个百分点,在 Video-MME-v2 等通用与长视频基准上也有显著收益。

所属事件:Qwen 发布 OmniReasoning 音视频联合推理基准与 30B 模型(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →