StemFX 将音乐混音建模为 token 预测,训练覆盖 10.5 万首歌

affige_yang · x · 2026-08-04

这篇论文在做什么

作者提出 StemFX,把音乐混音风格建模成一个自回归 token 预测问题,目标是为每个分离出的 stem 预测可变长度的 FX 链。

方法要点

结果

在 mixing style retrieval 上,StemFX 在所有测试的链长度下都优于基线模型;在 paired mixing style transfer 上,它也拿到了最好的频谱保真度和整体表现。

所属事件:StemFX将音乐混音风格建模为token预测(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →