乐谱转 MIDI 再喂模型:结构化表示优于音频扩散方案

felpix_ · x · 2026-09-07

作者提出音乐生成模型的更优路径:先经乐谱光学识别(OMR)转为 MIDI,再用 MIDI 作为模型的输入输出,而非让通用 LLM 直接处理音频。相比以音频片段为输出的 audio transformer 或对整条音轨做扩散的方案,MIDI 提供了更结构化的训练空间。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →