小红书 FireRedTTS3:统一语音生成与编辑模型

jiqizhixin · x · 2026-08-26

小红书 FireRedTeam 发布 FireRedTTS3,支持 24 种语言和 21 种中文方言的克隆、设计与编辑。

核心技术 RedAE 语音编码器在初始阶段即将语义注入声学表征,无需独立模块或多阶段流水线。该模型支持零样本语音克隆(数秒音频)、文本描述的声音设计以及精准语音编辑(仅修改高亮片段)。

性能方面,该模型在语音克隆准确度和相似度(3.04% WER / 78.8% 相似度)上获双项第一,在 24 语言克隆(3.75% / 84.8%,其中 22 种语言前二)以及声音设计和语音编辑基准测试中均取得领先成绩。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →