Sony AI 开源 MIMO 迭代音频分离框架,任意模型可套用
petewoodbridge · x · 2026-09-10
Sony AI 发布 MIMO 迭代音频分离扩展:一个与架构无关的通用框架,能把任何单步音频源分离模型改造成迭代精修模型,并严格保持混合一致性(mixture consistency)。
核心思路:
- 不提出新网络骨干,而是把现有单步推理模型扩展为多输入多输出(MIMO)配置
- 每轮迭代接收上一步所有估计的源信号作为输入,对全部目标 stem 做联合互相精修
- 兼顾扩散式多步精修的感知质量与传统单步模型的严格混合一致性
已应用到 SCNet(Vocals/Bass/Drums/Other)和 BS-RoFormer(Vocals/Accompaniment),带来更干净的卡拉OK人声去除、更好的乐器隔离、更少的泄漏与伪影。论文和 PyTorch 官方实现均已开源,对音乐制作人、DJ、音频修复和音乐生成等场景实用。
所属事件:Sony AI开源MIMO迭代式音乐分离通用框架(2 条相关)→
「多模态」频道最新
- Suno 老用户怒斥:付费生成的歌曲竟无法完整下载 — NickPassig · 2026-09-11
- MiniMax H3 视频实测:实拍画面叠加动态排版一气呵成 — Hailuo_AI · 2026-09-11
- GPT image 新模型出图 20MB,配合免费放大工具可冲到万像素级 — vista8 · 2026-09-10
- Reddit 用户发布首部叙事型 AI 短片《To Nora》 — Individual_Item_3140 · 2026-09-10
- AI 动画被忽视的道具表:一次生成避免结局「幻觉穿帮」 — socialwithaayan · 2026-09-10
- 工作室花数百万做的 AI 动画,他称一个下午就能复刻 — socialwithaayan · 2026-09-10