小红书FireRedTTS3统一语音生成与编辑,多评测第一
机器之心 · wechat · 2026-08-21
小红书FireRed团队发布新一代语音模型FireRedTTS3,用一个模型统一了多语言多方言克隆、自然语言声音设计和精准语音编辑三大能力。
核心突破:RedAE 语音表示
- 引入语义教师模型,在训练阶段将语义信息注入连续语音表示中,缓解了自回归生成的误差累积问题。
- 避免了量化带来的声学细节损失,保留了音色微细特征。
模型架构
- 基于 LLM-DiT 框架,包含 Aggregator、Backbone Transformer 和 DiT 模块。
- 分为 Base 版(专注克隆)和 Instruct 版(支持指令控制的设计与编辑)。
评测成绩
- Seed-TTS-Eval:中英文零样本克隆音色相似度第一。
- MiniMax-MLS-Test:24种语言克隆平均相似度 84.8%,错误率 3.75%。
- InstructTTSEval:声音设计指令跟随能力全面领先。
- Ming-Freeform-Audio-Edit:语音编辑(声学与语义)指标均处于领先地位,实现了“改得准、其余不变、音色不漂”。
「多模态」频道最新
- Causal-rCM 开源:流式视频生成与蒸馏方案 — chenhsuanlin · 2026-08-21
- 阿里发布 HappyShrimp 模型,Minimax 开源 Music3 — thursdai_pod · 2026-08-21
- 网友用 Grok 与 Kling AI 制作诗意视频 — creatoroff · 2026-08-21
- 网友用视频生成做出字面意义的「猫鱼」:猫头鱼身合体 — littleteckmonkey · 2026-08-21
- 实测 99% 方案后的最佳 AI 广告制作工作流 — EXM7777 · 2026-08-21
- Grok 一键生成并剪辑人类迁徙视频 — JoeJustice · 2026-08-21