InSight-doc: Agentic Visual Perception for Long-Document Understanding
Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang
cs.CV, cs.CL, cs.LG
2026-08-11
InSight-doc 把 Qwen3-VL-8B 训成按需放大的 agent:长文档问答反超 GPT-5.4-mini,延迟省 41%–68%、幻觉降四成以上。
长文档视觉问答普遍遇到两个麻烦。把每一页都按高分辨率喂进模型,token 数随输入近似平方级膨胀,推理又慢又贵;上下文一旦变长,模型又会「上下文腐烂」(context rot),塞得越多反而答得越差。常见解法要么把所有页喂成高分辨率(贵),要么接一个外部检索器先筛页面(要建索引,还可能漏掉关键页)。
作者想模拟人读长文档的方式:先扫一遍全局,只在需要时放大某块区域看细节。难点在于让模型自己学会什么时候放大、放大哪里,而且不依赖外部检索器。
InSight-doc 基于 Qwen3-VL-8B-Instruct,把它训成一个会调用 zoomin 工具的 agent。推理时模型一开始只拿到全部页面的低分辨率版本(50–100 DPI),过程中可以反复发起放大:给出要放大第几张图、一段自然语言描述(想看哪个区域),以及一个边界框坐标,系统就把对应的高分辨率裁剪块拼回推理链当证据。放大过的区域还能再放大,缩放因子按 r ← c·r 累积递进。
这套行为是训出来的,不是天然就会。作者分两阶段训练:
低分辨率起步(r=0.25,约 50 DPI)时提升最猛:
| 基准 | Qwen3-VL-8B | InSight-doc-8B | 提升 |
| DUDE | 52.9 | 70.1 | +17.2 |
| MP-DocVQA | 65.1 | 83.4 | +18.3 |
| MMLongBench-Doc | 33.7 | 50.8 | +17.1 |
| LongDocURL | 50.5 | 63.3 | +12.8 |
| 平均 | 50.5 | 66.9 | +16.4 |
中等分辨率(r=0.5)下提升收窄到平均 +4.3,因为高分辨率本来就更接近上限。同一档(r=0.25)下这个 8B 模型平均 66.9%,把 GPT-5.4-nano(51.2%)、GPT-5.4-mini(64.3%)、GPT-5-mini(65.9%)都甩在后面;r=0.5 时和这几个闭源小模型基本打平。
效率账更值钱。50 DPI 跑出 66.9% 准确率,只用了 100 DPI 基线 68.3% 所需 token 的不到一半(省 58%)。在最长文档子集上,70 DPI 跑出 56.2%(基线 53.2%),token 从 136.8k 砍到 42.4k,省 69%。延迟对应下降:长文档基准上省 41%–68%,最长子集单例从 39.3 秒降到 11.2 秒(省 71%),而且准确率还更高。
幻觉方面,在无法回答的问题上测 F1(看模型敢不敢承认答不了):DUDE 从 44.5 涨到 69.1,MMLongBench-Doc 从 48.5 涨到 74.4,对应幻觉率降四成以上。跟同类专门方法比,InSight-doc 是唯一同时做到「无检索器 + 由粗到细 + 迭代 + 区域级」的,在 MMLongBench-Doc 拿 57.8、LongDocURL 拿 65.6,分别比此前最好的 Doc-V 高 15.7 和 9.3 个点。
长文档多模态理解是实在的工程场景(读论文、读财报、读合同),而高分辨率喂全部页是当前最常见也最烧钱的方案。InSight-doc 给了一个干净的替代:用一个 8B 的开源 agent,在准确率不输甚至反超闭源模型的前提下,把推理成本压到原来的零头。代码、数据、模型都开源,可以直接拿来试。RL 阶段把「卡死」轨迹(stuck rate)从 9.7% 压到 0.1%、证据框覆盖率从 27.5% 提到 82.3%,说明训练学到的确实是该放大哪里,不是乱点。
作者自己承认只验证了 Qwen3-VL-8B-Instruct 一个骨干,RL 也没试更高级的算法和奖励设计,这套方法换到别的模型或更大规模上效果如何,论文没有数据。相关工作的对照表里注明各方法的骨干、训练数据、输入分辨率、页数预算和评测协议都没统一控制,跨论文的数字只能定性比,不能当严格对照。主评测用的是 capped(封顶)设置,只对 MMLongBench-Doc 和 LongDocURL 有影响,但封顶与否确实会改变绝对分数。