VLM 证据归因不靠框,靠引用与检索更准
Zhuchenyang Liu · hf · 2026-07-28
这篇工作研究的是:在视觉文档理解里,怎样让模型给出答案的同时,可靠指向证据,而且不依赖坐标框或人工 region 标注。
- 作者在一个验证过的双语 CiteVQA 子集上,对比了两种接口:
- coordinate interface:模型直接输出证据框坐标;
- language interface:模型先用文本把证据原文 quote 出来,再由检索器把这些引文映射回页面区域。
- 在 6 个开源视觉语言模型上,语言接口把 evidence recall 从最多 8 个点 提升到 26–47,同时 hallucination 大约减半,而答案质量变化不大。
- 在此基础上,作者把“quote + retrieve”的流程做成训练脚手架。
- 他们用 GRPO 训练模型更好地引用证据,reward 由标准答案判断和检索区域 crop 共同组成,从而不需要 region-level supervision。
- 在一个 8B backbone 上,strict attributed accuracy 从 22.4 提升到 33.8。
- 结论是:证据归因并不一定非要坐标接口,也不一定要昂贵的区域级标注。
「多模态」频道最新
- TopviewAI 推出 Film Studio,支持 3D 分镜和微表情控制 — XFreeze · 2026-07-28
- GaussianGPT 用自回归 next-token 生成 3D Gaussian 场景 — rsasaki0109 · 2026-07-28
- 图像生成避坑:如何正确测试混合了画风的角色LoRA — Dark_Sytze · 2026-07-28
- FilmBench 用电影学院 shot list 评测视频生成 — Shengyi Wang · 2026-07-28
- OPD 重新审视 CFG:分支感知蒸馏修复负分支失衡 — Bingnan Li · 2026-07-28
- Oxygen-TryOn 以时尚原生模型做多件虚拟试衣 — JD-company · 2026-07-28