苹果开源 LensVLM-9B,用压缩图像承载长文档省 token

苹果在 Hugging Face 上开源发布 9B 参数视觉语言模型 LensVLM,基于 Qwen3.5-9B 微调。其核心思路是把长文档文本渲染成压缩的小幅页面图片后整体输入模型,再通过学习到的工具按需解压展开相关页面,从而大幅节省上下文占用与算力。论文与代码已同步公开在 arXiv。

2026-09-24 ~ 2026-09-24 · 2 条相关