腾讯开源 Youtu-Parsing-Omni,统一解析文档 OCR 与音视频
tencent · hf · 2026-10-09
腾讯在 Hugging Face 发布 Youtu-Parsing-Omni,一个 image-text-to-text 的多模态模型,基于 youtuvita 架构。
模型以文档解析(document parsing)为核心能力,同时支持 OCR 与音频、视频输入,提供 transformers/safetensors 权重,可直接用 transformers 库加载。适合做通用文档理解与多模态内容抽取流水线。
「模型」频道最新
- 开发者称 90% 编码工作已交给 Grok bot 处理 — jonathan_wilke · 2026-10-09
- State of AI 2026 发布:预测 AGI 2027 年到来,九大趋势前瞻 — FinanceYF5 · 2026-10-09
- Anthropic 编码领先但未全面碾压 OpenAI,Astra 6.1 将至 — haider1 · 2026-10-09
- ChatGPT 500 美元档实测:周上限约 90M Sol + 25M Luna tokens — airesearch12 · 2026-10-09
- 博主吐槽:让 Opus 仿我声音做视频,比写人味文字容易多了 — tobowers · 2026-10-09
- 实践分享:拿 Jev 当通用分类器,便宜快到值得 best-of-n — max_paperclips · 2026-10-09