214 次 API 调用实测 Ling-3.0-flash-VL:小票核账抓出 30 元差错
alifcoder · x · 2026-09-23
作者用 214 次 API 调用系统实测 Ling-3.0-flash-VL 的图片与视频理解能力。亮点测试:一张 12 行商品、合计 2092.10 元的结算单(900×870),作者用三步问法(先自算合计、再给打印值、最后判断是否一致),模型约六秒内逐行核算,成功发现 30 元的差错。
短视频细节识别同样表现亮眼。作者同时测试了小字 OCR、计数、图表读数等边界场景,是少见的大规模系统性实测。
「模型」频道最新
- Matt Shumer 盛赞 Anthropic 新模型:「Anthropic 赢了」 — mattshumer_ · 2026-09-24
- 博主实测聊天机器人 Jeb:有偏见但不稳定,需当作分类器校准 — PawarBI · 2026-09-24
- 用宝可梦测前沿模型泛化:Astra 通杀随机地图与同人作,新模型多靠记忆 — gleech · 2026-09-24
- 模型通关同人游戏「Pokemon Brown」:泛化在涨,但打地鼠式训练仍在 — gleech · 2026-09-24
- 传 OpenAI 与 Anthropic 内部模型领先公开发布版约两个月 — haider1 · 2026-09-24
- AI 检测器争论:研究者称 Pangram 是唯一靠谱的那个 — paulnovosad · 2026-09-24