qinglong-captions v4.7.0 详细更新:多模态 OCR 与底层模型大升级
bdsqlsz · x · 2026-08-02
图像打标工具 qinglong-captions 发布 v4.7.0 版本,带来多项多模态与模型支持更新:
- OCR 与乐谱识别:引入 OvisOCR2 图像与 PDF OCR(支持 Transformers 及兼容 OpenAI 的 vLLM 后端),并将 MuSViT 升级为完整的 ONNX 乐谱识别工作流,支持导出 MusicXML/MIDI。
- 模型统一与更新:统一了 Kimi K3 模型选择与推理控制,更新了 Gemini 3.x 和 MiniMax M2.7 模型目录。
- 图像处理优化:强制执行了图像提示词模板的输入输出契约,并同步了 LayerDiff 和 Marigold 的上游行为。
所属事件:图像打标工具 qinglong-captions 发布 v4.7.0 更新(2 条相关)→
「多模态」频道最新
- 音乐超分 LLM:是否存在类似视频超分的音频增强模型? — LeatherRub7248 · 2026-08-24
- 描述梦境给AI龙,它即生成星球带你体验 — repligate · 2026-08-24
- 用金缮纹理修复3D模型编辑后的裂缝 — repligate · 2026-08-24
- 用 FL2VA 模型制作汉尼拔角色视频 — Nimblecloud13 · 2026-08-24
- MiniMax H3 助力复活中世纪短视频创作,工作流全公开 — zanatas · 2026-08-24
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24