DeepSeek 开源 OCR 2 模型:引入视觉因果流,精准转 Markdown
tom_doerr · x · 2026-08-11
DeepSeek 正式开源了 DeepSeek-OCR 2 模型及相关代码。该模型引入了“视觉因果流”技术,旨在探索更接近人类的视觉编码方式,能够高效地将图片和 PDF 文档转换为 Markdown 格式。
项目已在 GitHub 上获得 3.2k Star。环境配置方面,官方提供了基于 CUDA 11.8 + Torch 2.6.0 的详细安装指南,并支持通过 vLLM(0.8.5版本)和 Transformers 进行推理部署。
「模型」频道最新
- 上下文压缩竟违规?开发者吐槽 Anthropic 条款更新 — nptacek · 2026-08-11
- DeepSeek Harness v4 发布,Logo 曝光 — teortaxesTex · 2026-08-11
- 吐槽:受够了吹捧便宜模型达到 Opus 水准的评测水文 — xeophon · 2026-08-11
- DeepSeek 高峰期响应变慢,算力瓶颈显现 — ricklamers · 2026-08-11
- Muse Glimmer 智能体评测落后,但工具调用与幻觉控制优于同级 — ArtificialAnlys · 2026-08-11
- OpenAI 推出限制更少的模型,专供网络安全防御者使用 — lofty23_smart · 2026-08-11