腾讯开源 Youtu-Parsing-Omni,统一解析文档 OCR 与音视频

tencent · hf · 2026-10-09

腾讯在 Hugging Face 发布 Youtu-Parsing-Omni,一个 image-text-to-text 的多模态模型,基于 youtuvita 架构。

模型以文档解析(document parsing)为核心能力,同时支持 OCR 与音频、视频输入,提供 transformers/safetensors 权重,可直接用 transformers 库加载。适合做通用文档理解与多模态内容抽取流水线。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →