DeepSeek 开源 OCR 2 模型:引入视觉因果流,精准转 Markdown

tom_doerr · x · 2026-08-11

DeepSeek 正式开源了 DeepSeek-OCR 2 模型及相关代码。该模型引入了“视觉因果流”技术,旨在探索更接近人类的视觉编码方式,能够高效地将图片和 PDF 文档转换为 Markdown 格式。

项目已在 GitHub 上获得 3.2k Star。环境配置方面,官方提供了基于 CUDA 11.8 + Torch 2.6.0 的详细安装指南,并支持通过 vLLM(0.8.5版本)和 Transformers 进行推理部署。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →