AnswerMap:免训练黑盒方法让VLM空间解释AUC达0.85
Mohamed Eltahir · hf · 2026-09-29
MIT 研究者(Mohamed Eltahir 团队方向)发布 AnswerMap,一种免训练、任务无关的黑盒 VLM 视觉归因方法。
方法
- 将图像切成 K 行 K 列条带,逐条喂给冻结模型配 yes/no 相关性问题;行、列「yes」后验的外积即得到查询条件下的空间归因图
- 在归因图上定义固定读出(期望、最大值等),可原生导出定位等连续输出,绕开对离散文本 token 的依赖
忠实性验证(4 模型 × 3 查询分布)
- 归因图与模型自指点位置吻合:AUC 0.85(注意力图仅 0.38)
- 删除归因图区域会翻转 53% 的正确回答(注意力仅 19%)
三种读出用法
- 最大值读出可不经生成直接标记幻觉物体;期望读出在模型自身指点失败时仍能正确定位;将归因图高质量区域裁剪回喂模型,可修复一半的错误回答
「多模态」频道最新
- Dreamina 时间戳提示词加单图参考的实测玩法展示 — gen_ericai · 2026-09-29
- 用 C++ 自制管线测试时间戳提示词生成「盲女巫」图像 — gen_ericai · 2026-09-29
- Kling 4.0 多参考生成实测:一次合成角色、场景、物件,还能多语言复用 — SarahAnnabels · 2026-09-29
- BananaStudio:跑在 Gemini Canvas 里的全分辨率图像生成工作台 — Z3ROCOOL22 · 2026-09-29
- Suno Studio 演示:录一段人声即可转成电吉他等任意音色 — suno · 2026-09-29
- Qwen 2.1 图像默认工作流被吐槽,改 CFG=3、12 步后细节超 Krea 2 — Dear-Spend-2865 · 2026-09-29