ISMIR 2026 论文 MPEcho 用音素条件降低翻唱歌词错误
affige_yang · x · 2026-08-04
MPEcho 用音素级条件控制可控翻唱生成
这篇 ISMIR 2026 论文提出了 MPEcho,把旋律信息和音素信息一起用于可控翻唱生成。方法是在 SongEcho 框架中加入 phoneme encoder 和 length regulator,不再只依赖 voiced/unvoiced 标签来隐式携带歌词信息,从而提升歌词控制能力。
作者还开发了一个基于 Whisper 的音素转写管线 Phonsa,用于给唱歌语音生成高精度音素标注,缓解高质量音频-音素配对稀缺的问题。论文实验表明,这套方案能显著降低 phoneme error rate(PER),让翻唱生成在歌词对齐上更可靠。代码、Demo 和权重已公开。
所属事件:MPEcho 利用音素时序优化翻唱生成(3 条相关)→
「多模态」频道最新
- 开源 SARAS:把主题直接生成完整视频的平台 — sai_teja_ · 2026-08-04
- 拉片工具 v0.5.1 上线 AI 直连分析,支持多家模型 — sujingshen · 2026-08-04
- MM H3 在 3090 上本地实测:5–15 秒片段要 500–900 秒 — TensorTinkererTom · 2026-08-04
- MM H3 在 3090 上本地实测:5–15 秒片段要 500–900 秒 — TensorTinkererTom · 2026-08-04
- ChatGPT 提示词做出 10 秒 Blender 环绕动画 — goodside · 2026-08-04
- MiniMax-H3 文生视频 GGUF 量化版在 Hugging Face 走红 — realrebelai · 2026-08-04