Legato 2 按谱表逐行识别,弦乐四重奏扫描 OMR-NED 砍到 31.6

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith

cs.CV, cs.AI

2026-07-07

华盛顿大学的 Legato 2 用 YOLO 切谱表、113.7M 视觉语言模型逐系统转写 ABC,并能认出标题等嵌入文字。相机拍摄的弦乐四重奏上 OMR-NED 从 Legato 1 的 58.2 降到 31.6。

这篇在解决什么

光学乐谱识别(OMR)长期卡在两头:流水线模块会把误差一路传下去;端到端模型要么一次只看一行谱表,要么把整页当一张图,丢掉乐谱从左到右、系统接系统的读法。嵌入文字(标题、作曲家、行内标注)更是神经网络 OMR 的盲区,Legato 1 直接用一个 <|text|> 占位符把文字丢掉。

通用视觉语言模型在乐谱理解题上也不行。MusiXQA 的难拆上,不给转写时 Gemini 3 Flash 只有 8.4、GPT 5 Mini 只有 8.0。这篇把 OMR 做成给前沿 VLM 用的符号上下文,而不是再训一个全能乐谱大模型。

方法

三条流水线。YOLOv8 medium(约 2600 万参数)先从每页切出谱表系统,微调数据是 1024 页人工框,一半来自合成训练集 PDMX-Synth,一半来自 IMSLP 真实排版。识别器从 Llama-3.2-11B-Vision 初始化,可训练参数 1.137 亿。它一次转写一个系统,条件是当前系统图像加上最多 1024 token 的前文 ABC;上下文总长 2048。最后规则转换器把系统级 ABC 拼回标准、按声部组织的 ABC。

关键设计是系统级 ABC:每个系统的编码不依赖后面还没看见的声部,训练和推理才能按阅读顺序走。分词器在 BPE 上加 byte fallback,词表 4096,罕见字符走字节,不再把文字抹掉。歌词仍排除在外,作者认为歌词和结构耦合弱,留给现成 OCR。

下游理解很简单:把 Legato 2 的转写和原图一起喂给 GPT-5 或 Gemini 3.1 Pro,让它们选用符号上下文。

结果

页级 OMR-NED(越低越好):

数据集AudiverisGemini 3.1 ProLegato 1Legato 2
PDMX-Synth 测试 411 页56.390.328.623.5
渲染弦乐四重奏 252 页64.693.532.917.1
相机弦乐四重奏 252 页75.494.158.231.6
IMSLP 钢琴 32 页71.589.144.334.2

密谱收益最大:相机四重奏从 58.2 掉到 31.6。消融显示,系统切分一项就把验证集从 70.2 拉到 48.5,byte fallback 主要换来识字能力,词表 4096 按验证集选中。

文字方面,相机四重奏总 CER:Audiveris 73.8、Gemini 58.1、Legato 2 24.8。标题 CER 10.6,对 PaddleOCR 的无序 CER 是 25.1 对 85.5。作曲家名仍差,因为模型常把页码认成作曲家。

理解任务:MusiXQA 上 Gemini 3 Flash 从无转写的 8.4 到 Legato 1 的 20.1、Legato 2 的 25.3。SSMR-Bench 上 Gemini 3.1 Pro 从 71.4 到 84.8 再到 92.7。

为什么重要

给从业者的用法很具体:别逼通用 VLM 直接读五线谱,先跑一个按系统切的专用 OMR,再把 ABC 当上下文。113.7M 的识别器和前沿 VLM 搭配,比把整页塞进 Gemini 便宜也准。代码和数据写明发表后公开。

局限与存疑

作者承认两点。资源不够,YOLO 切错如何污染下游 VLM 推理还没有定量。训练全是合成谱,真实雕版风格、扫描质量、手写记号会掉点;相机 Lieder 上 43.6 对 Legato 1 的 44.9,几乎没拉开。多页评测只和 Legato 1 比:按累计长宽比分箱后,2 的曲线全程更高、掉点更慢,作者把稳定性归因于训练和推理都采用相同的左截断。歌词故意不做。作曲家 CER 仍接近 100。OMR-NED 绝对数字也谈不上「干净转写」,31.6 仍是三成编辑距离。

术语

原文与代码

社区讨论

相关论文

全部论文解读