小红书开源 20 亿参数 TTS 模型 dots.tts,连续自回归实现低延迟高保真克隆

小红书技术REDtech · wechat · 2026-08-13

小红书 dots 团队开源了 20 亿参数的端到端语音合成模型 dots.tts。该模型跳过传统的离散声学 Token,直接在连续隐空间中进行自回归生成,从而在保持高保真音色克隆和长程稳定性的同时,大幅降低了推理延迟。

在 Seed-TTS-Eval 评测中,dots.tts 取得了同级别系统中的最佳平均内容准确度和说话人相似度。此外,团队通过自纠正对齐和蒸馏技术,将生成步骤压缩至单步、两步或四步。在双流交互模式下,模型首包延迟最低可达 54.4 毫秒,非常适合实时语音 Agent 等场景。

本次开源不仅提供了预训练、低步数生成等六个检查点,还完整放出了训练、微调、蒸馏及双流推理代码(采用 Apache 2.0 协议)。同时,团队还推出了支持文本、情绪、韵律精确编辑的 dots.tts.edit。

所属事件:小红书开源20亿参数TTS模型dots.tts(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →