ISMIR 2026 论文 MPEcho 用音素条件降低翻唱歌词错误

affige_yang · x · 2026-08-04

MPEcho 用音素级条件控制可控翻唱生成

这篇 ISMIR 2026 论文提出了 MPEcho,把旋律信息和音素信息一起用于可控翻唱生成。方法是在 SongEcho 框架中加入 phoneme encoder 和 length regulator,不再只依赖 voiced/unvoiced 标签来隐式携带歌词信息,从而提升歌词控制能力。

作者还开发了一个基于 Whisper 的音素转写管线 Phonsa,用于给唱歌语音生成高精度音素标注,缓解高质量音频-音素配对稀缺的问题。论文实验表明,这套方案能显著降低 phoneme error rate(PER),让翻唱生成在歌词对齐上更可靠。代码、Demo 和权重已公开。

所属事件:MPEcho 利用音素时序优化翻唱生成(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →