手机拍照文本进电脑:OCR、视觉模型与 Agentic 流水线选择讨论
silenceimpaired · reddit · 2026-09-23
楼主开始玩 agentic 工作流后发现第一个瓶颈是把手机拍的文本可靠地导入电脑。手机虽有自动 OCR,但到电脑端结果就丢了,想自动化整条链路。他打算用 pi.dev 监控文件夹,把每张图片转成文本再拼接成最终文档,并考虑 OCR 与视觉模型双路 + agentic harness 投票取优。他还想要一个图像模型把渣手机照「修」成扫描件级别的文档,初步认为图像编辑模型可部分胜任,发帖征集大家的工具与模型推荐。
「编程与Agent」频道最新
- 评测第一步是发现错误:跳过它就会衡量错误的问题 — FinanceYF5 · 2026-09-23
- AI 产品易改难测:Evals 把「好」变成可重复的上线检查 — FinanceYF5 · 2026-09-23
- MCP 是个坏主意吗?视频引发智能体协议反思 — RelevantEmergency707 · 2026-09-23
- 开发者演示:输入文字即变成对应 UI 的魔法文本框 — BLUECOW009 · 2026-09-23
- 把 Opus 5.5 拉满写 wildcard,它跑了 2 万次迭代只为不写错 a/an — mwoody450 · 2026-09-23
- 独行者用 MiniMax+Tripo+Blender 做出战斗短片,公开完整流程求指点 — Spoonman915 · 2026-09-23