哈工大提出 EASE:证据锚定空间注意力,让多模态 RLVR 答对也看对地方
jiqizhixin · x · 2026-09-11
哈尔滨工业大学与中关村学院提出 EASE(Evidence-Anchored Spatial Attention),被 EMNLP 2026 Findings 接收。
- 成绩:Qwen2.5-VL-7B +2.9 分、Qwen3-VL-4B +3.1 分、Qwen3-VL-8B +2.5 分,均超过最强的 outcome-only 基线 DAPO
- 发现的盲点:多模态 RLVR 中仅用结果奖励会提升准确率,但模型的关注区域与图像证据位置系统性错位——答对了却没看对地方
- 方法:构建证据标注管线生成支撑答案区域的 bounding box,仅作训练元数据、不作模型输入;每个框转为 2D 高斯(2σ 覆盖框宽/高一半),多框等权混合防止大框主导,再加 10% 背景平滑增强容错,形成过程级奖励信号
「研究」频道最新
- 《Steerable Visual Representations》登ICML长口头报告 — y_m_asano · 2026-09-11
- OpenCVL 卫星图像配准数据集亮相 ECCV 2026 — ducha_aiki · 2026-09-11
- Diverse VPR 视觉场所识别工作投稿 ECCV 2026 — ducha_aiki · 2026-09-11
- P=NP 到底难在哪:排课表与电路布线才是真正的硬骨头 — thesaraharminta · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11
- MutexaGPT:LLM翻译直觉,分子动力学筛选酶突变,命中率40% — bravo_abad · 2026-09-11