LightOnOCR-3 发布:三档尺寸开源 OCR 模型,转录+版面框一格搞定
IgorCarron · x · 2026-10-09
LightOnAI 在 Hugging Face 发布新一代轻量 OCR 模型家族 LightOnOCR-3,提供 0.8B、1B、4B 三个尺寸,Apache 2.0 许可,研究与商用均可自由使用。
- 能力升级:相比上一代,速度与转录质量显著提升,并新增视觉理解能力——可为所有文档区域输出带标签的 bounding box、生成图像描述、把图表中的数值数据抽取成表格,可替代复杂的多级文档理解 pipeline。
- 两种模式:空 prompt 时按原有接口转录页面;用 grounding 作为 prompt 则在转录之外附加带标签边框、图像描述与图表数据。
- 架构:1B 沿用旧架构,0.8B 与 4B 采用 Qwen3.5 视觉语言架构,在精度、速度与算力间提供不同取舍。
- 全部开放:博客、Demo、代码与复现脚本均已开源。
所属事件:LightOn 开源 LightOnOCR-3:三尺寸模型问鼎 OCR 榜单(22 条相关)→
「模型」频道最新
- Grok 机器人一次成功 Amazon 下单,购物 agent Muse 两度失败 — jamesperkins · 2026-10-10
- Google AI Pro 订阅捆绑 Colab 权益:80GB A100 可全参微调 Gemma 31B — algo_diver · 2026-10-10
- 比人更聪明的模型,每百万 token 只收 0.1 美元 — dan_s_becker · 2026-10-10
- 马斯克演示 Grok 可为任意主题生成模拟场景 — elonmusk · 2026-10-10
- Burkov断言:仅靠模型本身永远无法解决幻觉问题 — burkov · 2026-10-10
- 4GB 显存 10 分钟微调:Qwen3.5 0.8B 决策模型准确率 37% 升至 65% — danielhanchen · 2026-10-10