OmniReasoning:音视频联合推理基准,较 Qwen3-Omni 提升 12.8 点
_akhaliq · x · 2026-10-07
新工作 OmniReasoning 指出现有全模态模型的基准与训练方法大多把音频和视觉分开处理,音视频联合推理能力被低估且未被充分激发,并提出基准+数据+方法三件套:
- OmniReasoningBench:1150 道选择题与开放式问题,音频与视觉证据缺一不可,覆盖视频内推理与超越视频的推理两类任务。
- OmniQA 数据引擎:自动构造以证据为锚的音视频联合 QA 对,附带时间戳线索链,产出 OmniReasoning-SFT-112K 与 RL-19K 训练数据。
- MFSD 自蒸馏方法:在模态特定线索上下文下评估每个采样回答,解耦单模态贡献与跨模态交互,实现 token 级 credit assignment。
模型 OmniReasoning-30B-A3B 在 OmniVideoBench 达 50.0%、OmniReasoningBench 达 42.5%,比基座 Qwen3-Omni-30B-A3B-Thinking 分别提升 12.8 和 9.3 个百分点,在 Video-MME-v2 等通用与长视频基准上也有显著收益。
所属事件:Qwen 发布 OmniReasoning 音视频联合推理基准与 30B 模型(2 条相关)→
「多模态」频道最新
- fofr 用 NB 2.1 跑网页设计 prompt 实验 — fofrAI · 2026-10-07
- 手机实时操控 3D 场景:音频驱动程序化装置 demo 迭代 — DimitriDeJonghe · 2026-10-07
- 开发者用 HeyGen Video 1 做互动叙事 App:用户日均停留超 60 分钟 — HeyGen · 2026-10-07
- AI 制作后末日剧集《THE FINISHED WORLD》放出正式预告片 — No-Party-2924 · 2026-10-07
- Jordi Pons 推出 AI 互动音乐游戏「一只鸡死了」 — jordiponsdotme · 2026-10-07
- LichtFeld 稠密化插件大提速:85.5 秒降至 16.7 秒 — janusch_patas · 2026-10-07