FocusVTC按需放大,RULER87.4反超Glyph

FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

FangZhi Zhong, Xuerui Qiu, Yuqi Pan, Ya Liu, Shaowei Gu, Bo Xu, Guoqi Li

cs.CV, cs.AI

2026-09-29

FocusVTC低清通读再局部高清放大,RULER 87.4分、压缩2.9倍,Glyph同设置仅57.5。

这篇在解决什么

长上下文推理的注意力、延迟和 KV cache 都随长度涨。视觉文本压缩(Visual Text Compression,VTC)把文字渲成页面图,让视觉语言模型用更短的视觉 token 覆盖全文。Glyph 靠密排渲染加持续预训练走通了这条路,DeepSeek-OCR 则从光学压缩重建文本。

固定分辨率把「看清局部」和「整页花多少 token」绑在一起。DPI 低,token 少,字糊到连 UUID、易混字母都读不准;DPI 高,不相干段落也按高清计价。多数问题只依赖文档里一小块。全局覆盖和精确阅读可以拆开。

方法

FocusVTC 来自中科院自动化所、国科大、上海交大和中关村学院,骨干是 Qwen3.5-9B。推理时模型先看低 DPI 全局页,再选动作:直接给出答案,或调用 Enhance Region(page, bbox)。工具从对齐的 144 DPI 页按原页坐标裁高清块,框归一化到 [0, 1000],低清和高清共用同一套坐标。像先扫缩略图,再对可疑段落放大。没有单独的持续预训练。

字体先对着骨干的 OCR 偏好校准。十五种字体、八档字号,用随机文本测字符错误率(CER)。DejaVu Sans 和 Verdana 都在 9 pt 首次降到 CER≤5%,DejaVu Sans 在约 32K 文本上下文上只要 8368.4 个视觉 token,Verdana 要 8417.8;在 cl、rn、i 这类易混串上再低 0.30 个百分点。同一套训练换字体,LongBench 从 54.93 升到 56.40。默认 9 pt、行距再加 1 pt。一张 72 DPI 的 A4 页对齐到 32 的倍数后是 608×832 像素、494 个视觉 token。

训练数据是 29411 条 Reasoning-Evidence Localization 思维链(REL-CoT):每一步推理钉到页码和框。原料以 ChatQA、ChatQA2 为主,补 TriviaQA、HotpotQA、2WikiMultihopQA、MuSiQue、FinQA。DeepSeek V4 Flash 先丢掉凭常识就能答的题,避免模型不读文档走捷径;Gemini 3.5 Flash 写带页码和框的推理;GPT-5 mini 独立检查高清裁块是否撑得住参考答案。

两段训练:

SFT 之后直接打开工具会掉点:LongBench 从 37.86 掉到 25.41。Qwen3.5-9B 裸接工具同样全面下滑。crop 接口本身不是增益,策略必须学会何时放大、放大哪一块、何时停。跳过 SFT 直接 GRPO,LongBench 只有 49.30,补上 SFT 才到 56.40;VTCBench 推理是唯一的例外,无 SFT 的 38.15 略高于完整模型的 36.25。

结果

评测默认 72 DPI 进、144 DPI 裁,字体 DejaVu Sans。

方法指标结果
FocusVTCRULER v1 @ 72 DPI87.38,输入压缩 2.9×(prompt 2154 + 观察 723,对照文本 8400)
GlyphRULER v1 @ 72 DPI57.53,压缩 3.0×
Qwen3.5-9B 视觉、不裁RULER v137.40
FocusVTCLongBench56.40
Qwen3.5-9B 文本LongBench55.86
GlyphLongBench52.34

相对同一骨干的固定 72 DPI,LongBench 高出 20.54 分,涨幅集中在单文档、多文档 QA 和合成检索。MRCR 按六个长度档、二针四针八针做宏平均,从 31.65 到 45.56。分针平均 60.76 / 45.21 / 30.71,Glyph 是 42.63 / 25.97 / 16.57。最长档文本参考 197909 token,prompt 53181,加上观察后压缩约 3.3×、3.1×、3.0×。在 300 道配对的 64K-128K 四针题上,两张 A100 80GB、张量并行 2、贪心解码,在线端到端从 187.09 秒降到 67.06 秒,加速 2.79×,这里不含离线渲染;生成 token 从 5411.30 降到 1529.77。

VTCBench 宏平均 51.19:检索 91.00、推理 36.25、记忆 26.33。检索和记忆在 32K、64K 档优势最大。推理平均仍低于同骨干纯视觉的 41.57,只在最长两档超过固定分辨率。摘要几乎不动,证据铺在全篇时放大用不上。少样本结果有好有坏,示范往往跨多个区域。

RULER 从 48 扫到 144 DPI,FocusVTC 对起始分辨率更不敏感。72 DPI 时 prompt 加观察最短。再低,额外观察变多,总 token 反而不省;起步 144 DPI,输入 token 约 2.8 倍,分数只高一点。把整页分辨率一起拉高,是在给无关文字买单。

通用多模态分数没有被冲掉:MMMU 从 65.12 到 66.73,MME 从 2424.02 到 2457.62,OCRBench 从 851 到 860,DocVQA 从 92.38 到 92.43,ChartQA 从 85.96 到 86.28,InfoVQA 从 74.76 到 76.20。

为什么重要

对要在约 9B 视觉模型上吞长文档的人,这是一条可复现的后训练路径:2.94万条定位数据,SFT 再加 GRPO,不必做 Glyph 那种持续预训练。相近压缩比下,RULER v1 从 57.5 拉到 87.4,长上下文在线延迟也下来。代码已开源。

机制对得上「答案在几段里」的任务:多跳 QA、大海捞针、局部定位。摘要、全篇推理、VTCBench 式关联推理不要指望同样涨幅。字体和 CER 门槛是对着 Qwen3.5 的 OCR 偏好调的,换骨干要重测。

局限与存疑

附录写明:只有 9B 骨干和 2.94万条 REL-CoT,更大模型、更多语言、版式和推理轨迹还没做;完整交互成本和答案质量也还没放在同一套标尺上。延迟数字剔除了页面渲染,线上现渲的话 2.79× 会打折。

实验没有直接打 related work 里的 AGAR、SEER、DeepEyes,对照停留在固定分辨率 VTC 和文本骨干。数据管线绑着 Gemini 3.5 Flash、GPT-5 mini、DeepSeek V4 Flash 三个教师,框的质量跟这些模型走。未训过的模型接上放大工具会掉点,「有 crop 接口」不是免费增益。八针 MRCR 在 128K-256K 仍只有 15.69。

术语

原文与代码

相关论文

全部论文解读