DEFINE:零样本 TTS 分离音色与口音,单一模型可迁移口音
amaai-lab · hf · 2026-10-05
amaai-lab 发布 DEFINE,一个端到端零样本 TTS 框架,把说话人身份与目标口音解耦,分别由不同的音频样本控制。
要点
- 基于 F5-TTS 加 LoRA 轻量适配,用口音样本编码器(经学习到的口音原型监督)构建条件空间;
- 推理时无需口音标签,也无需后处理波形转换,单一引导权重即可连续控制口音强度,不用重训练;
- 已见口音上,加大引导使口音探针准确率从 6.5% 升至 19.6%;
- 单模型在已见与域外口音上达到两模型 TTS+声转换级联的口音迁移效果,同时说话人相似度更高;训练集之外的 held-out 口音上不成立。
「多模态」频道最新
- UniMate 发布 3D 绑定骨骼模型,网友提议接入 ComfyUI — RazsterOxzine · 2026-10-05
- AI 歌曲《Close all the windows》制作全流程公开:提示词与 Midjourney 素材全放出 — Afinetheorem · 2026-10-05
- OctLLM 用八叉树显式编码 3D 几何,兼顾语言能力与空间结构 — _akhaliq · 2026-10-05
- Gemma 31b「Grand Horror」+ H3 生成恐怖短片引围观 — jrexthrilla · 2026-10-05
- EditHero:首个长程部件级 3D 编辑基准,对比两种编辑路线 — _akhaliq · 2026-10-05
- Suno + KlingAI 打造斯洛伐克语说唱 MV「Stoka Roka」 — Jazzlike_Animator_70 · 2026-10-05