VisionCoach:用 RL 奖励正确视觉注意力,刷新视频推理零样本成绩
mohitban47 · x · 2026-09-10
ECCV 2026 论文 VisionCoach 提出一个强化视频推理的 RL 框架,核心思路:
- 视频推理模型常看错地方或依赖语言先验;与其只监督最终答案,不如让模型学会关注正确的视觉证据。
- 用 RL 奖励正确的视觉注意力,训练时以动态视觉提示(visual prompting)充当「教练」改善时空定位。
- 通过自蒸馏让推理阶段保持简单、无需额外工具。
- 在视频推理、视频理解与时序定位等多个 benchmark(V-STAR 等)上取得零样本 SOTA。
论文将于 9 月 10 日 16:30 CEST 在 ExHall Poster #148 展示。
「研究」频道最新
- CoopEval 框架发布:系统比较多智能体合作机制的实用工具 — conitzer · 2026-09-10
- Open Yap 1K 开源:1000 小时真实双人对话语音,可商用 — realmrfakename · 2026-09-10
- Hank Yang:AI 擅长前人定义好的问题,人类价值转向定义问题本身 — hankyang94 · 2026-09-10
- 雅可比猜想风波:Anthropic 数学家回应被疑用了公开泄露论文 — suchenzang · 2026-09-10
- NNsight 0.8 预发布:vLLM 近原生速度与 MoE 支持 — davidbau · 2026-09-10
- ECCV 报告:具身 AI 需预测动作、证据推理与流式效率三大能力 — CSProfKGD · 2026-09-10