OmniSeek:让全模态大模型学会主动“看与听”检索证据
Haibo Wang · hf · 2026-10-02
OmniSeek 提出一个 agentic 框架,把 Omni-LLM 从被动一次性处理整段音视频序列,转变为多轮主动推理智能体:模型动态决定何时看、何时听以及观察哪个时间窗口,跨模态检索稀疏但关键的证据,并把原始音视频片段追加回上下文继续推理。
要点:
- 构建数据引擎合成 OmniTraj-170K:带交错音视频证据的多跳思维链轨迹,用于冷启动多轮工具使用行为;
- 随后用两阶段可验证奖励强化学习优化策略;
- 引入 Audio-Visual Necessity 目标,奖励真正依赖双模态的成功轨迹,抑制单模态捷径;
- 在多项基准上持续提升音视频推理表现。
「编程与Agent」频道最新
- LAHacks 学生作品 Residue:用声学分析为你匹配最佳学习环境 — jonmarkgo · 2026-10-02
- 700 个工具的 awesome-jev 清单:专管生产环境的「决策模型」生态 — Remarkable-Gur719 · 2026-10-02
- 花 1 万美元推理费,AI 几天完成人类专家需数年的 TS 转 C++ 移植 — kristoph · 2026-10-02
- Basis Theory 推出可撤销凭证,让 Agent 能行动但不碰你的密钥 — km · 2026-10-02
- smolvm v1.22 发布:agent 动作可撤销,快照恢复近瞬时 — LoganGrasby · 2026-10-02
- Spawn 作者长文:AI 时代还有几年正常期,什么才值得造 — TAbrodi · 2026-10-02