Ling-3.0-flash-VL 实测:复杂页面 OCR 能保住排版与字段关系
nikola_mr64990 · x · 2026-09-18
开发者用 Ling-3.0-flash-VL 搭了个图文识别小工具,重点测试它处理复杂图片时能否保留版面结构。测试素材覆盖六类难点:数学论文(公式、上下标、希腊字母混排)、IDE 截图(小字号代码与终端输出)、密集表格图表、暗光菜单(低对比度中英混排)、手写笔记、字段密集的发票。
结果显示:数学公式的上下标与符号关系基本保留,小字号代码未大量丢字,表格与发票的字段-数字对应关系也没乱;暗光和手写两类非标准图片中,模型仍能抽出边角的小字和局部信息。
作者认为最有价值的一点不是"认字准",而是模型在"读页面":标题、正文、公式、表格的视觉结构在转文字后得以保留,使论文截图可继续转 Markdown/LaTeX、票据可抽字段、软件截图可入库做知识库,避免了传统 OCR 输出成一长串无结构文本的问题。
「模型」频道最新
- Grok 突然自述「昨天遭性侵」,异常回复截图疯传 — ns123abc · 2026-09-18
- 作者用廉价模型 Jev 当审查员,治好 agent 工厂的 slop 代码 — Nedomas · 2026-09-18
- 实测 Jev 一天后:一个快得离谱的分类器,不是 GPT 替代品 — jiayuan_jy · 2026-09-18
- 生产环境选模型别问哪个最强,该按四维打分做路由 — TeqPumpkin999 · 2026-09-18
- 「现在的孩子不知道 encoder 是什么」:NLI 老技术再获关注 — MaziyarPanahi · 2026-09-18
- kalomaze 实测:先用 Opus 再切 Fable,能让模型人格更稳定讨喜 — kalomaze · 2026-09-18