StemFX 将音乐混音建模为 token 预测,训练覆盖 10.5 万首歌
affige_yang · x · 2026-08-04
这篇论文在做什么
作者提出 StemFX,把音乐混音风格建模成一个自回归 token 预测问题,目标是为每个分离出的 stem 预测可变长度的 FX 链。
方法要点
- 用带 FiLM conditioning 的 band-split multi-band CNN 编码器,捕捉每个 stem 的频谱结构。
- 为了扩大训练规模,研究者从大约 10.5 万首歌中做源分离,抽取 pseudo-stems。
- 他们还整理了 MultiAfx 工具包,把来自 7 个 Python 库的 85 种音频效果统一起来。
结果
在 mixing style retrieval 上,StemFX 在所有测试的链长度下都优于基线模型;在 paired mixing style transfer 上,它也拿到了最好的频谱保真度和整体表现。
所属事件:StemFX将音乐混音风格建模为token预测(2 条相关)→
「多模态」频道最新
- 创作者用 FLUX、WAN 和自建管线做出 AI 视频粗剪 — Ok_Experience_1 · 2026-08-04
- 开源 SARAS:把主题直接生成完整视频的平台 — sai_teja_ · 2026-08-04
- 拉片工具 v0.5.1 上线 AI 直连分析,支持多家模型 — sujingshen · 2026-08-04
- MM H3 在 3090 上本地实测:5–15 秒片段要 500–900 秒 — TensorTinkererTom · 2026-08-04
- MM H3 在 3090 上本地实测:5–15 秒片段要 500–900 秒 — TensorTinkererTom · 2026-08-04
- ChatGPT 提示词做出 10 秒 Blender 环绕动画 — goodside · 2026-08-04