qinglong-captions 更新:引入 OvisOCR2 与钢琴谱识别模型
bdsqlsz · x · 2026-08-02
图像打标工具 qinglong-captions 发布 4.7.0 版本更新。本次更新新增了 OvisOCR2 图像 OCR 功能,并引入了作者自行训练的 MuSViT OMR 模型用于光学乐谱识别。
目前该乐谱识别模型基于官方数据集训练,暂仅支持识别钢琴谱,作者表示后续版本将尝试支持全谱识别。
所属事件:图像打标工具 qinglong-captions 发布 v4.7.0 更新(2 条相关)→
「多模态」频道最新
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24
- MiniMax H3 本地生成 Pudgy Penguins 音乐视频 — cocktailpeanut · 2026-08-24
- Thrixel 一小时生成可玩 3D 森林与 BOSS — RanaHanocka · 2026-08-24
- 30 年动画人用 AI 赋予角色生命,作品 The Latent Stroke — Paferkas-71 · 2026-08-24
- 用 Minimax H3 制作风世界开场动画,含完整工作流 — Routine_Ad_3391 · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24