FocusVTC:自适应分辨率视觉文本压缩,RULER 得分 87.4
FangZhi Zhong · hf · 2026-09-30
Hugging Face 上的新工作 FocusVTC,通过自适应分辨率打破视觉文本压缩(把文本渲染成图省 token)的压缩-性能权衡。要点:
- 低 DPI 省 token 但牺牲可读性,高 DPI 把 token 浪费在无关内容上;FocusVTC 用低 DPI 全局图+选择性区域增强,把增强视图整合进推理过程。
- 构建 29.4K 条 REL-CoT 思维链示例,将推理轨迹与页码、边界框关联;用 REL-SFT 教模型定位相关区域,GRPO 学何时增强分辨率及如何使用观察结果。
- 72 DPI 下 RULER v1 得 87.4(2.9 倍输入压缩),同压缩率下 Glyph 仅 57.5;LongBench 56.40 超过文本输入 backbone,MRCR 宏平均提升 13.91 分,在线端到端较文本加速 2.79 倍。
- 通用多模态能力不降反升:MMMU 65.12→66.73,MME 2424→2458。
「研究」频道最新
- 新论文:LLM生成的实验报告是“不可靠的转述者” — StellaLisy · 2026-10-01
- Liquid AI 发布 LongevityBench:小型 LFM 在多项衰老任务胜过前沿模型 — JosephJacks_ · 2026-10-01
- 2880 种病毒的蛋白复合物结构预测入 AlphaFold 数据库,约 30% 为全新发现 — AllThingsApx · 2026-10-01
- 微软 AI 预测太空天气风险,可提前 30-60 分钟预警电网 — Microsoft Research · 2026-10-01
- 实测发现:Isolation Forest 的 max_samples 设为 1.0 效果最佳 — Ragno_ · 2026-09-30
- Google 研究为 AI 设计蛋白质加水印,助识别潜在生物威胁 — Ars Technica AI · 2026-09-30