Omni-Decision:证据台账式规划,OmniGAIA 准确率 81.4%
Ming Ma · hf · 2026-09-30
新论文 Omni-Decision 聚焦全模态 agent(需在视频、音频、网页与计算之间找证据)的核心瓶颈——规划:嘈杂的多模态观察不断堆积进对话历史,扰乱后续决策。受控后端替换实验支持这一诊断:换掉规划器造成的性能损失远大于换掉感知后端。
方法:用显式的「证据台账(evidence ledger)」替代不断膨胀的对话历史,记录还缺什么证据、什么已确认、哪里有冲突。一个 critic 读取每个嘈杂观察,只把可用内容传给台账、其余丢弃,使规划器全程在紧凑上下文上工作。每次运行记录每步的 state、action 与 verdict,对这些轨迹做 SFT 和决策级 RL 进一步提升规划器。
结果:在 OmniGAIA 上达到 SOTA 的 81.4% 准确率,单题成本约为 Gemini-3.1-Pro 的 43%;在长视频理解 WorldSense 上拿到 65.0%,与最强端到端模型持平。
「编程与Agent」频道最新
- Luna 仅用 6%-7% 配额完成神经渲染客户端开发 — MickeySteamboat · 2026-09-30
- 在 Skill Hub 里复用专家经验:一条 Skill 让图表直接达到论文水准 — iamfakhrealam · 2026-09-30
- 合上电脑活照干:作者实测 KooKo Agent 自动完成论文整理任务 — iamfakhrealam · 2026-09-30
- 不靠 RL 和验证器,用模型自身解释训练 agent 反而提升编码能力 — CatAstro_Piyush · 2026-09-30
- ehartford 向 agentlanguages 仓库提交 With 语言:为人类和智能体共同设计的编程语言 — QuixiAI · 2026-09-30
- 开发者用 MCP 给 LLM 接上视频剪辑工具,告别「生成然后祈祷」 — ClickpopAI · 2026-09-30