免训练口音类比引导:跨语言语音克隆在同等口音下更保真说话人相似度
Yoomee Cho · hf · 2026-10-07
- 跨语言零样本文 TTS 中参考音频口音会泄漏进目标语音。论文提出 Accent Analogy Guidance(AAG),一个免训练的采样器项:用模型自身对同一合成声音的双语渲染估计口音方向并 subtract,使声音相消、只留口音。
- 提出 ΔSIM 指标衡量在同等口音下高于身份-口音权衡曲线的说话人相似度。四个开源 TTS 模型上 AAG 均在曲线之上:OmniVoice 三组测试集 ΔSIM +0.11+0.27;MaskGCT、CosyVoice 2、F5-TTS 同样受益,且能预测出无效的模型(X-Voice)。
- 验证方式包括 LLM 盲评口音评委、免 LLM 的语言 ID 度量与 12 人听测,三方结论一致。
「多模态」频道最新
- 让 Opus 拍「人生的意义」短片,作者称美得不像 AI — char-gen · 2026-10-07
- Reddit 分享 Stable Diffusion 角色离屏一致性技巧 — robertwellesley · 2026-10-07
- 用 MiniMax H3 复刻火影经典 OP,同人 MV 质量惊艳 — Automatic_Lynx_7777 · 2026-10-07
- LTX Director 多角色控制难题:动作与语音分离、角色串扰待解 — salazar_slick · 2026-10-07
- VEDA Sparse Attention 上线:MiniMax H3 视频模型接入 ComfyUI — robomar_ai_art · 2026-10-07
- VEDA 稀疏注意力登陆 ComfyUI,MiniMax H3 生视频提速近一倍 — robomar_ai_art · 2026-10-07