ISMIR 论文:用潜在扩散模型统一鼓点转录与音轨生成
affige_yang · x · 2026-08-05
自动鼓点转录(ADT)通常将混音直接映射为符号事件,但会丢失可用于混音编辑的音频主干。
这篇即将发表于 ISMIR 的论文提出了 Separate-and-Detect(分离与检测) 架构:
- 五轨潜在扩散模型:在紧凑的 VAE 潜在空间中,联合生成底鼓、军鼓、嗵鼓、踩镲和吊镲 5 条可编辑音轨。
- 固定检测器:将分离出的音轨转换为符号事件。
- 辅助训练分支:引入 Onset branch (OB) 和 Timbre branch (TB) 塑造模型,推理时直接丢弃(类似 dropout)。
在 MDB Drums 和 ENST-Drums 数据集上的实验表明,该方法不仅超越了基于 U-Net 的分离基线(整体转录 F1 更高),还在底鼓和军鼓的 F1 上优于端到端 ADT 系统,且能额外输出高质量分离音轨。
「研究」频道最新
- NeurIPS 征稿:聚焦智能体行为的以人为本解释 — mdredze · 2026-08-26
- 推理模型通过“失败恢复”机制超越非推理模型 — Jeande_d · 2026-08-26
- 研究称推理模型强化行为与正确性关联弱 — Jeande_d · 2026-08-26
- HOMIE Gen2 发布:360°视觉+空间音频解锁具身智能经验缩放 — liuziwei7 · 2026-08-26
- 研究揭示潜在学习比想象更强大,适用于标准微调 — johnhewtt · 2026-08-26
- Boris Dayma 分享新优化器 PSGD Kron 实验结果 — wandb · 2026-08-26