Vision-RL2:区域级强化学习让 MLLM 用 1/4 视觉 token 超越满分辨率
Yuheng Shi · hf · 2026-09-18
细粒度视觉感知通常靠提高分辨率,但视觉 token 增多会推高视觉编码与语言模型 prefilling 成本。作者通过受控诊断发现,「定位感兴趣区域」与「识别其内容」对分辨率的需求差异巨大:定位可容忍约 3–4 倍更强的 token 压缩。
由此提出 Vision-RL2:用区域级强化学习优化一个从模型注意力蒸馏出的轻量提案网络——把连贯区域当作动作,冻结的 MLLM reader 按「移除该区域后答案似然的变化」打分;减法与加法两类互补目标分别抑制干扰提议、补回缺失证据,全程不需要区域标注、响应采样或推理轨迹。精炼后的提案进一步支持只放大证据、剔除背景 token 的稀疏编码。
效果:在六个细粒度基准、四个 MLLM backbone 上,任意 token 预算下精度均超过基座模型,且用约 1/4 的视觉 token 即可超过基座在最大预算下的精度。代码已开源。
「研究」频道最新
- UCLA 用光做计算:光学图像生成模型媲美 10.7 亿参数扩散模型 — mtizard · 2026-09-18
- 纯 Rust 实现视觉/视觉惯性 SLAM 与定位,visloc-rs 开源 — rsasaki0109 · 2026-09-18
- Sakana AI 成立 FIG 研究组:智能尚未被解决,寻找 Transformer 之外的范式 — SakanaAILabs · 2026-09-18
- 手算 U-Net 全流程:17 步走完卷积、池化与跳跃连接 — ProfTomYeh · 2026-09-18
- 经济学博士论文:优化复杂效用函数需放弃理性一致性 — xuanalogue · 2026-09-18
- VIGA 线程续:论文应新增章节,专评当前大模型在该任务上的表现 — FinanceYF5 · 2026-09-18