VepAgent:工具增强强化学习让视频事件预测补上因果推理短板
UCSC-VLAA · hf · 2026-10-08
UCSC-VLAA 提出 VepAgent,一个面向视频事件预测(VEP)的智能体框架,结合因果过渡推理与工具增强强化学习。
- 问题:多模态大模型依赖回溯式总结和文本先验,难以推断未观察到的因果过渡,无法从历史轨迹主动推演未来事件。
- 方法:先构建 futurebench-4K 高质量思维链数据集用于 SFT,结构化推演未观察到的中间状态;再设计包含状态追踪、帧检索、区域放大的诊断工具库,让智能体在推理时动态调用工具补齐缺失的时空证据;并提出复合奖励机制,联合优化预测准确性、因果连贯性与可靠先验,迫使模型依赖真实视觉定位而非表层文本相似性。
- 结果:在 FutureBench 和 NEPBench 上取得 SOTA,显著超越更大的多模态模型。
「研究」频道最新
- FractAL 提出软策略选择,批式主动学习不再死守单一采集策略 — anshulkundaje · 2026-10-08
- DeLM 更新版实测:多智能体快 2.49 倍但评测口径各异 — jyangballin · 2026-10-08
- RAG 检索该不该做多样化?论文给出按查询自适应的判定规则 — _reachsumit · 2026-10-08
- Quantize by Drift:无需标签按表示漂移为嵌入模型选混合精度 — _reachsumit · 2026-10-08
- RunningTab 论文:让环境侧记账 Agent 读过什么、还欠什么任务 — RexDouglass · 2026-10-08
- ColPali 式文档索引可被反演还原页面,近半文本可读出 — _reachsumit · 2026-10-08