开源立体声转空间音频模型
kittenkrazy · reddit · 2026-07-18
作者开源了 Stereo2Spatial,一个把立体声音乐转换为空间化双耳混音的模型,并发布了训练/推理代码、Hugging Face 模型和 Windows 桌面应用。
关键实现
- 先做过基于 VAE latent 的方案,但受限于输出分布不匹配,音质出现瓶颈
- 随后改为直接建模原始波形,虽然更吃算力,但效果更好
- 训练过程中遇到不稳定问题,最终通过 amplitude lifting 解决:先把音轨按 RMS 归一化到 0.33,再乘回去扩大模型空间
训练与发布
- 使用 7,669 首曲目训练,耗时约 20 天,硬件为 2× A6000
- 分两阶段训练:前 10 天短序列,后 10 天长序列
- 支持可选的 mix-style 条件控制
- 目前先发布的是 双耳输出 版本,作者表示未来在有更多算力时可继续训练 7.1.4 版本
- 项目采用 Apache 2.0 开源
链接
- Hugging Face:stereo2spatial-v2-binaural 与 stereo2spatial-v1
- GitHub:训练/推理仓库和 Windows App 均已公开
- 还有详细 case study 记录从 latent 方案转向 waveform 方案的过程
「多模态」频道最新
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11
- 用 Midjourney+Seedance 把龙神宿敌大战拍成 AI 电影短片 — azed_ai · 2026-09-11