NVIDIA发布Nemotron Parse 2.0:支持图表解析与多语言OCR
pmttyji · reddit · 2026-08-06
NVIDIA在Hugging Face发布Nemotron Parse 2.0,该模型可将文档图像转换为结构化表示,包含文本、布局类别、边界框和阅读顺序。相比v1.2,新增约20k token词汇扩展以支持多语言,增加图表感知解析(<classChart>),并改进表格处理。适用于文档理解、RAG、数据提取等场景。
「多模态」频道最新
- 用 fal 工作流串联多款 AI 模型,一键生成 15 秒动画短片 — gorkem · 2026-08-07
- Qwen-3D 模型发布:融合多视角几何 cues 提升空间推理 — udmrzn · 2026-08-07
- 实测MiniMax H3:23分钟生成15秒原生音频视频 — AxonkaiLab · 2026-08-07
- 探讨 Claude 辅助 Veo 制作医学动画的可行工作流 — Hipposy · 2026-08-07
- 单次生成便宜没用?AI视频工作流的隐性成本更高 — Div_pradeep · 2026-08-06
- MiniMax H3 搭配 LLM 打造交互式虚拟人 Demo — joq100 · 2026-08-06