把分辨率当推理预算:8B 长文档模型反超 GPT-5.4-mini,延迟省 41%–68%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

cs.CV, cs.CL, cs.LG

2026-08-11

InSight-doc 把 Qwen3-VL-8B 训成按需放大的 agent:长文档问答反超 GPT-5.4-mini,延迟省 41%–68%、幻觉降四成以上。

这篇在解决什么

长文档视觉问答普遍遇到两个麻烦。把每一页都按高分辨率喂进模型,token 数随输入近似平方级膨胀,推理又慢又贵;上下文一旦变长,模型又会「上下文腐烂」(context rot),塞得越多反而答得越差。常见解法要么把所有页喂成高分辨率(贵),要么接一个外部检索器先筛页面(要建索引,还可能漏掉关键页)。

作者想模拟人读长文档的方式:先扫一遍全局,只在需要时放大某块区域看细节。难点在于让模型自己学会什么时候放大、放大哪里,而且不依赖外部检索器。

方法

InSight-doc 基于 Qwen3-VL-8B-Instruct,把它训成一个会调用 zoomin 工具的 agent。推理时模型一开始只拿到全部页面的低分辨率版本(50–100 DPI),过程中可以反复发起放大:给出要放大第几张图、一段自然语言描述(想看哪个区域),以及一个边界框坐标,系统就把对应的高分辨率裁剪块拼回推理链当证据。放大过的区域还能再放大,缩放因子按 r ← c·r 累积递进。

这套行为是训出来的,不是天然就会。作者分两阶段训练:

结果

低分辨率起步(r=0.25,约 50 DPI)时提升最猛:

基准Qwen3-VL-8BInSight-doc-8B提升
DUDE52.970.1+17.2
MP-DocVQA65.183.4+18.3
MMLongBench-Doc33.750.8+17.1
LongDocURL50.563.3+12.8
平均50.566.9+16.4

中等分辨率(r=0.5)下提升收窄到平均 +4.3,因为高分辨率本来就更接近上限。同一档(r=0.25)下这个 8B 模型平均 66.9%,把 GPT-5.4-nano(51.2%)、GPT-5.4-mini(64.3%)、GPT-5-mini(65.9%)都甩在后面;r=0.5 时和这几个闭源小模型基本打平。

效率账更值钱。50 DPI 跑出 66.9% 准确率,只用了 100 DPI 基线 68.3% 所需 token 的不到一半(省 58%)。在最长文档子集上,70 DPI 跑出 56.2%(基线 53.2%),token 从 136.8k 砍到 42.4k,省 69%。延迟对应下降:长文档基准上省 41%–68%,最长子集单例从 39.3 秒降到 11.2 秒(省 71%),而且准确率还更高。

幻觉方面,在无法回答的问题上测 F1(看模型敢不敢承认答不了):DUDE 从 44.5 涨到 69.1,MMLongBench-Doc 从 48.5 涨到 74.4,对应幻觉率降四成以上。跟同类专门方法比,InSight-doc 是唯一同时做到「无检索器 + 由粗到细 + 迭代 + 区域级」的,在 MMLongBench-Doc 拿 57.8、LongDocURL 拿 65.6,分别比此前最好的 Doc-V 高 15.7 和 9.3 个点。

为什么重要

长文档多模态理解是实在的工程场景(读论文、读财报、读合同),而高分辨率喂全部页是当前最常见也最烧钱的方案。InSight-doc 给了一个干净的替代:用一个 8B 的开源 agent,在准确率不输甚至反超闭源模型的前提下,把推理成本压到原来的零头。代码、数据、模型都开源,可以直接拿来试。RL 阶段把「卡死」轨迹(stuck rate)从 9.7% 压到 0.1%、证据框覆盖率从 27.5% 提到 82.3%,说明训练学到的确实是该放大哪里,不是乱点。

局限与存疑

作者自己承认只验证了 Qwen3-VL-8B-Instruct 一个骨干,RL 也没试更高级的算法和奖励设计,这套方法换到别的模型或更大规模上效果如何,论文没有数据。相关工作的对照表里注明各方法的骨干、训练数据、输入分辨率、页数预算和评测协议都没统一控制,跨论文的数字只能定性比,不能当严格对照。主评测用的是 capped(封顶)设置,只对 MMLongBench-Doc 和 LongDocURL 有影响,但封顶与否确实会改变绝对分数。

术语

原文与代码

相关论文

全部论文解读