苹果开源 LensVLM-9B:压缩图像承载文本,按需展开相关页面
jacek2023 · reddit · 2026-09-24
苹果发布 9B 视觉语言模型 LensVLM,思路是把文本渲染成压缩图像后整体输入模型,再通过学习到的工具按需把相关页面解压展开,从而节省上下文与算力。论文与代码已公开(arXiv:2605.07019,GitHub ml-lensvlm),Hugging Face 上已有 bartowski 的 GGUF 量化版。模型权重基于 Qwen 修改,采用 Apple Machine Learning Research Model License,源码则按 Apple Sample Code License 单独分发。
所属事件:苹果开源 LensVLM-9B,用压缩图像承载长文档省 token(2 条相关)→
「研究」频道最新
- Anthropic:Claude 在噬菌体 DNA 中发现未知酶系统 — KevinKaichuang · 2026-09-24
- 新基准 TRACES 不看答案对错,专评 AI 解决未知问题的过程能力 — dr_cintas · 2026-09-24
- ECCV MMBU 基准揭示:视觉语言模型答对题却认不出图像模态 — davidjhwu · 2026-09-24
- 研究发现:作者其实能较准预测自己哪篇论文高被引 — RexDouglass · 2026-09-24
- Applied Compute 用 Jev 自动聚类 RL 训练中的失败模式 — rhythmrg · 2026-09-24
- 递归自我改进的经济学:AI 加速自身的成本收益账 — CFGeek · 2026-09-24