乐谱转 MIDI 再喂模型:结构化表示优于音频扩散方案
felpix_ · x · 2026-09-07
作者提出音乐生成模型的更优路径:先经乐谱光学识别(OMR)转为 MIDI,再用 MIDI 作为模型的输入输出,而非让通用 LLM 直接处理音频。相比以音频片段为输出的 audio transformer 或对整条音轨做扩散的方案,MIDI 提供了更结构化的训练空间。
「多模态」频道最新
- Figma Weave 节点画布:多 AI 模型与专业修图工具一站式编排 — gizakdag · 2026-09-07
- 「如果 GTA 发生在纽约」:AI 生成视频走红 Reddit — tres_pares · 2026-09-07
- GPT-6 Astra + Magnific MCP 一条工作流产出电影感广告与落地页 — charis_ai · 2026-09-07
- AI 像人一样开 Blender 引争议:该生成文件还是操作软件? — AIandDesign · 2026-09-07
- RTX 3090 上 112 组测试寻找 MiniMax H3 最佳参数组合 — badincite · 2026-09-07
- Seen2Scene 开源:只用真实残缺扫描训练 3D 场景补全,入选 ECCV 2026 — angelaqdai · 2026-09-07