多模态 RAG 里,OCR 如何利用整页文档上下文

MediocreAd3005 · reddit · 2026-07-22

作者在做一个多模态 RAG 管线:先用 Mistral OCR 给图片做标注,再把标注结果和文档文本一起进向量库。

他遇到的问题是:OCR 现在是把图片单独处理,所以生成的注释缺少整份文档的上下文,信息不够完整。作者因此在求两类建议:

这条本质上是在问:怎么让 OCR + 多模态 RAG 更懂上下文。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →