腾讯开源 5B 全模态解析模型 Youtu-Parsing-Omni
腾讯在 Hugging Face 开源 5B 参数的全模态解析模型 Youtu-Parsing-Omni,基于 youtuvita 架构的 image-text-to-text 多模态模型。单次输入文档页、自然图像、图表/流程图、几何图形、音频或视听视频,即可输出统一的结构化解析结果,将文档 OCR 与音视频解析整合到一个模型中。
2026-10-09 ~ 2026-10-09 · 2 条相关
- 腾讯开源 Youtu-Parsing-Omni,统一解析文档 OCR 与音视频 — tencent · 2026-10-09
- 腾讯开源 5B 全模态解析模型 Youtu-Parsing-Omni — jacek2023 · 2026-10-09