StemFX将音乐混音风格建模为token预测
一篇计划投往 ISMIR 2026 的论文提出了 StemFX 模型。该研究创新性地将音乐混音风格转化为自回归 token 预测问题,旨在为分离出的音轨预测可变长度的音频效果链。据悉,该模型的训练数据涵盖了多达 10.5 万首歌曲,展现了数据驱动方法在音乐制作领域的最新探索。
2026-08-04 ~ 2026-08-04 · 2 条相关
- StemFX 将音乐混音建模为 token 预测,训练覆盖 10.5 万首歌 — affige_yang · 2026-08-04
- ISMIR 2026 论文把音乐混音建模为 token 预测 — affige_yang · 2026-08-04