Tacit-TTS:免转写零样本声音克隆,比 IndexTTS2 快 10 倍
Jian Chen · hf · 2026-10-02
Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的高效免转写零样本声音克隆系统,核心改进:
- 用掩码非自回归生成替代自回归的文本到语义解码,消除顺序解码延迟
- 引入免训练的声学时长估计,并通过 ReFlow 蒸馏加速 flow-matching 渲染器
- 在两个英文和两个中文数据集上达到与 IndexTTS2 有竞争力的零样本质量,同时超过 5 秒的语句生成速度提升 10 倍以上
免转写 conditioning 还支持跨语言与非语音参考:作者用 8 种其他语言、婴儿咿呀声和合成乱语做参考验证,这类输入对依赖转写的系统常因 ASR 错误而退化或失败。
「多模态」频道最新
- Invoke 7 开启合并 PR:三个月 320 个 PR 重写画布引擎与界面 — joshwcorbett · 2026-10-02
- 山岳级风暴龙视频 prompt 全文:四镜头电影级生成拆解 — ArjanDoge · 2026-10-02
- BFL 开放 FLUX Tools 免费试用,商用模型权重可联系获取 — bfl_ai · 2026-10-02
- FLUX 3 Image 发布:黑森林工作室推新一代文生图模型 — chrisfirst · 2026-10-02
- MiniMax H3 复刻 1991 年动画《Doug》,效果出乎意料 — Certain_Potato_4509 · 2026-10-02
- ChatGPT 上线虚拟试衣:上传自拍即可试穿衣服与配饰 — TechCrunch AI · 2026-10-02