模型从模糊 PDF 截图准确认出紧固件标准手册书名
iplawguy · reddit · 2026-09-12
Reddit 用户 iplawguy 因工作需要识别一张 PDF 中模糊的棕色大书照片,把整份文档喂给「Sol 5.6 medium」模型后,模型准确答出这是 Industrial Fasteners Institute 的《Book of Fastener Standards》,连书脊上的文字都读了出来,还严谨地指出具体版本号因压缩照片无法辨认。作者对模型的视觉识别能力印象深刻。
小案例,但展示了模型在低质量图像上的细粒度文字识别(OCR 级)能力。
「模型」频道最新
- Smaug Flash 开源发布:主打个人 Agent 场景,价格再砍 3 成 — bindureddy · 2026-09-12
- Reddit 用户恳求新模型别再只卷 agentic coding,怀念 4.5 时代文风 — warlordthe99th · 2026-09-12
- 中美实验室共用同批数据供应商,模型差异究竟来自哪里? — biotechplays · 2026-09-12
- Grok 官宣「迄今最智能模型」:更长上下文与更清晰推理 — xiaosun86 · 2026-09-12
- 开发者吐槽:Claude 会漏活,Codex 过于死板还自作主张 — rickasaurus · 2026-09-12
- Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量 — zhyncs42 · 2026-09-12