手机拍照文本进电脑:OCR、视觉模型与 Agentic 流水线选择讨论

silenceimpaired · reddit · 2026-09-23

楼主开始玩 agentic 工作流后发现第一个瓶颈是把手机拍的文本可靠地导入电脑。手机虽有自动 OCR,但到电脑端结果就丢了,想自动化整条链路。他打算用 pi.dev 监控文件夹,把每张图片转成文本再拼接成最终文档,并考虑 OCR 与视觉模型双路 + agentic harness 投票取优。他还想要一个图像模型把渣手机照「修」成扫描件级别的文档,初步认为图像编辑模型可部分胜任,发帖征集大家的工具与模型推荐。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →