Apple 开源 LensVLM-9B:把长文档转成页面图片省 token
victormustar · x · 2026-09-24
Apple 在 Hugging Face 上发布了 LensVLM-9B,一个基于 Qwen3.5-9B 的微调模型。其思路是把长文档压缩成小幅页面图片以节省 token,回答问题时再只调取与问题相关页面的完整文本。
这种「页面图像检索 + 按需展开全文」的方式为长文档处理提供了省 token 的新路径,模型已开源可下载。
所属事件:苹果开源 LensVLM-9B,用压缩图像承载长文档省 token(2 条相关)→
「模型」频道最新
- ChatGPT 语音可调用插件并接入 GPT-6 三款模型,全球推送 — romainhuet · 2026-09-24
- GPT-6 Luna 医疗成绩超上代旗舰,价格便宜约 34 倍 — BorisMPower · 2026-09-24
- 爆论:模型「变笨」或因异构 GPU/TPU 混用推理,质量不一 — michellechen · 2026-09-24
- 网友吐槽:别把消费级产品「Max」式命名套路搬到 LLM 身上 — scaling01 · 2026-09-24
- 罗马团队 Limite 1B 开源,竞赛数学成绩胜过数十倍体量模型 — tensorqt · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24