多模态 RAG 里,OCR 如何利用整页文档上下文
MediocreAd3005 · reddit · 2026-07-22
作者在做一个多模态 RAG 管线:先用 Mistral OCR 给图片做标注,再把标注结果和文档文本一起进向量库。
他遇到的问题是:OCR 现在是把图片单独处理,所以生成的注释缺少整份文档的上下文,信息不够完整。作者因此在求两类建议:
- 有没有适合“机器对机器”图片描述模型的提示词指南,能把上下文注入进去;
- 有没有更适合的模型或工作流,能天然考虑周围文档上下文。
这条本质上是在问:怎么让 OCR + 多模态 RAG 更懂上下文。
「应用」频道最新
- 独立维修师傅想用 AI 接电话,但怕乱报价和超区派单 — ccchhannn · 2026-07-22
- OpenAI 推出企业版 Presence,部署语音与聊天智能体 — OpenAI · 2026-07-22
- Michaels 称 Gemini 购物助手几周内处理了 7.5 万次对话 — gaganghotra_ · 2026-07-22
- 陶哲轩用 ChatGPT 拆解 Jacobian 猜想反例 — tdhopper · 2026-07-22
- OpenAI Codex Micro 收到上手评测,售价 230 美元加税 — Dimillian · 2026-07-22
- 开发者做出 The Daily Diff AI 工程资讯站 — arpit_bhayani · 2026-07-22