苹果开源 LensVLM-9B:压缩图像承载文本,按需展开相关页面

jacek2023 · reddit · 2026-09-24

苹果发布 9B 视觉语言模型 LensVLM,思路是把文本渲染成压缩图像后整体输入模型,再通过学习到的工具按需把相关页面解压展开,从而节省上下文与算力。论文与代码已公开(arXiv:2605.07019,GitHub ml-lensvlm),Hugging Face 上已有 bartowski 的 GGUF 量化版。模型权重基于 Qwen 修改,采用 Apple Machine Learning Research Model License,源码则按 Apple Sample Code License 单独分发。

所属事件:苹果开源 LensVLM-9B,用压缩图像承载长文档省 token(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →