VLM 证据归因不靠框,靠引用与检索更准

Zhuchenyang Liu · hf · 2026-07-28

这篇工作研究的是:在视觉文档理解里,怎样让模型给出答案的同时,可靠指向证据,而且不依赖坐标框或人工 region 标注。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →