小红书开源 20 亿参数 TTS 模型 dots.tts,连续隐空间生成达 SOTA

机器之心 · wechat · 2026-08-13

小红书 dots 团队与上海交大联合开源了 20 亿参数的端到端语音合成基础模型 dots.tts。该模型放弃了主流的离散 Token 路线,创新性地在连续隐空间中进行自回归生成,从而保留了更丰富的音色与韵律细节。

在 Seed-TTS-Eval 等主流零样本声音克隆测试中,dots.tts 取得了平均内容准确度与音色相似度的 SOTA 表现。此外,模型原生支持流式输出,配合双工对话系统首包延迟低至 54.4 毫秒。此次开源包含基础模型、自纠正对齐、多步及单步蒸馏等六个检查点,并全面开放了训练与微调代码。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →