小红书 FireRedTTS3:统一语音生成与编辑模型
jiqizhixin · x · 2026-08-26
小红书 FireRedTeam 发布 FireRedTTS3,支持 24 种语言和 21 种中文方言的克隆、设计与编辑。
核心技术 RedAE 语音编码器在初始阶段即将语义注入声学表征,无需独立模块或多阶段流水线。该模型支持零样本语音克隆(数秒音频)、文本描述的声音设计以及精准语音编辑(仅修改高亮片段)。
性能方面,该模型在语音克隆准确度和相似度(3.04% WER / 78.8% 相似度)上获双项第一,在 24 语言克隆(3.75% / 84.8%,其中 22 种语言前二)以及声音设计和语音编辑基准测试中均取得领先成绩。
「多模态」频道最新
- 单图转海报:AI 生成非重复感励志海报 — aziz4ai · 2026-08-26
- 赛博朋克射手:末日一击 — Deepdun888 · 2026-08-26
- Midjourney 技巧:利用负空间营造电影感 — tisch_eins · 2026-08-26
- LichtFeld Studio展示完整开源3D高斯泼溅工作流 — janusch_patas · 2026-08-26
- 商汤开源 SenseNova U1.5 Lite:8B 参数原生 4K 生成与精准编辑 — HeyNayeem · 2026-08-26
- 照片级真实感有三条独立轴线,大多数工作流只修了两条 — 24Latents · 2026-08-26