Qwen 发布 OmniReasoning:音视频联合推理基准与 30B 模型
Qwen · hf · 2026-10-06
Qwen 团队推出音视频联合推理的完整方案,指出此前全模态模型的基准、数据与方法大多把模态分开处理,音视频协同推理长期缺乏评估与激发。
三项产出
- OmniReasoningBench:1,150 道选择题与开放式问题,音频与视觉证据缺一不可,覆盖「视频内推理」与「超视频推理」两类任务。
- OmniQA 数据引擎:自动构造需音视频联合推理的证据锚定 QA 对,并生成带时间戳线索链的思考过程标注,产出 SFT 数据 112K 与 RL 数据 19K。
- MFSD 训练方法:模态因子化自蒸馏,在模态专属线索上下文下评估各采样回答,实现 token 级 credit assignment。
结果:OmniReasoning-30B-A3B 在 OmniVideoBench 达 50.0%、OmniReasoningBench 达 42.5%,较基座 Qwen3-Omni-30B-A3B-Thinking 分别提升 12.8 与 9.3 个百分点,在 Video-MME-v2 等通用与长视频基准上也有显著增益。
「多模态」频道最新
- 「全息数据投影」提示词分享:一键生成科幻风人物投影 — azed_ai · 2026-10-06
- 开源 huashu-art-motion skill:35 种艺术风格让画动起来 — AlchainHust · 2026-10-06
- 一条提示词跑通 Claude Opus 与 Seedance 视频生成 — Itchy-Car-904 · 2026-10-06
- RTX 5080 本地跑 MiniMax H3:17 秒 720p 视频要多久? — off_rs · 2026-10-06
- RTX 5060 8GB 上跑 Krea 2:LoRA 保角色+Chroma 定构图的写实工作流 — Wide_Director_8897 · 2026-10-06
- Reddit 展示 AI 生成动漫舞台:烟雾闪电氛围大片 — Amazing_Skill_6080 · 2026-10-06