Ollama-OCR:基于本地视觉模型提取 PDF 和图像文本
tom_doerr · x · 2026-08-09
Ollama-OCR 是一款利用本地视觉语言模型(通过 Ollama)从图像和 PDF 中提取文本和表格的开源工具。
- 支持模型:包括 LLaVA、Llama 3.2 Vision、Granite3.2-vision、Moondream 及 Minicpm-v 等。
- 主要特性:支持多种输出格式,提供 Python 包和 Streamlit Web 应用两种使用方式。
- 适用场景:适合需要完全在本地运行、处理复杂文档(如图表、信息图)的 OCR 任务。
「编程与Agent」频道最新
- AI 智能体硬核通信:靠改文件名和 base64 互传消息 — AccBalanced · 2026-08-09
- AI编程提速引发技术债务担忧:代码复杂度上升 — ingliguori · 2026-08-09
- 开源本地实时语音栈:Ollama 串联 Qwen 实现端到端对话 — InternationalGap3698 · 2026-08-09
- NVIDIA API 免费提供 DeepSeek 等多款主流大模型,附上手教程 — dr_cintas · 2026-08-09
- Codex耗时11小时,执着于2帧音频差异 — ___Patrice___ · 2026-08-09
- LLM 成本优化实战:隐形重试与 4k 系统 Prompt 是烧钱元凶 — Dalius-Gabryelle · 2026-08-09