Adobe 推出 OmniSeek:让 Omni 模型主动检索音视频证据做多轮推理
mohitban47 · x · 2026-10-10
Adobe 团队发布论文 OmniSeek,把 Omni-LLM 从被动一次性处理音视频序列,改造成会主动"找证据"的多轮推理智能体。
核心做法:
- 原生多轮工具调用:模型动态决定何时看、何时听、回看哪个时间段,检索稀疏但关键的音视频片段,把原始证据追加进推理上下文;
- OmniTraj-170K:合成的 17 万条多跳 CoT 轨迹,交错嵌入音视觉证据,用于冷启动监督训练;
- SFT + 两阶段 RL,并设计 Audio-Visual Necessity 奖励,惩罚走单模态捷径的推理。
效果:在全部 10 个音视频基准上超越 Qwen3-Omni-Instruct 底座,其中 VideoHolmes 提升 15.5 个百分点。
「多模态」频道最新
- 两块 GPU 烧 48 小时跑本地视频模型,全 AI 流程做出音乐 MV — tetsuoai · 2026-10-10
- 用「相信你自己」提示法调教 LLM 写 3D SDF 模型实测 — keenanisalive · 2026-10-10
- 不用 mesh 和 3DGS,他用 LLM 写 27KB GLSL 代码生成 3D 龙 — keenanisalive · 2026-10-10
- 尼康因参赛作品使用生成式 AI,撤销显微视频大赛冠军 — nordicinst · 2026-10-10
- 「假视频水平已再上一个台阶」,AI 换脸逼真度引担忧 — rohanpaul_ai · 2026-10-10
- 设计师纯代码做发布视频:Remotion+Three.js+Suno 全流程拆解 — lmoroney · 2026-10-10