小红书开源 20 亿参数 TTS 模型 dots.tts,连续隐空间生成达 SOTA
机器之心 · wechat · 2026-08-13
小红书 dots 团队与上海交大联合开源了 20 亿参数的端到端语音合成基础模型 dots.tts。该模型放弃了主流的离散 Token 路线,创新性地在连续隐空间中进行自回归生成,从而保留了更丰富的音色与韵律细节。
在 Seed-TTS-Eval 等主流零样本声音克隆测试中,dots.tts 取得了平均内容准确度与音色相似度的 SOTA 表现。此外,模型原生支持流式输出,配合双工对话系统首包延迟低至 54.4 毫秒。此次开源包含基础模型、自纠正对齐、多步及单步蒸馏等六个检查点,并全面开放了训练与微调代码。
「多模态」频道最新
- 实测多智能体协作:用 Opus 5 与 3D 工具构建水下基地游戏 — majidmanzarpour · 2026-08-13
- MiniMax 漫画转真人实测:动态效果惊艳 — ajrss2009 · 2026-08-13
- AVA-Encoder:面向智能体的原生视频表征学习 — Chuyue Li · 2026-08-13
- RTX 3060 实战 Minimax-H3:低显存视频放大与远距离人脸修复指南 — Support_Marmoset · 2026-08-13
- VisionDepth3D:基于 AI 深度图的 2D 转 3D 视频工具 — tom_doerr · 2026-08-13
- LTX 2.5 图生视频实测:3D CGI 机器人专访大片 — b-totherent · 2026-08-13