谷歌发布Gemini 3.8 TTS双模型,30秒克隆声音
Google 于 9 月 23 日发布两款新一代文本转语音模型 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,官方称其为「最具表现力的音频生成模型」。Flash 版面向高保真创意制作(游戏、有声书、播客),Flash-Lite 版面向大批量、低成本场景,两者覆盖 100+ 语言,开发者可通过 Google AI Studio 使用。这是 Google 在 TTS 领域的一次重要升级。
已确认
- 支持 30 秒音频克隆声音,或用一句话自然语言描述从零设计全新声音人格,适用于游戏、有声书、双人播客等场景
- 提供声音库,可按语言、口音、性别、音高、人设筛选,含 2000+ 预置音色
- 可逐行/逐句导演表演提示、风格与节奏,支持插入 <laughs> 等自然提示以及附和声与方言切换,ammaar 亦提到 expressive 标签可精细控制语气
- 据 Philschmid 转述,模型在 Hume 语音设计榜登顶,并在 Voice Arena 六种语言评测中均排名第一
- 据 Artificial Analysis 数据,模型发音鲁棒性评测登顶,但在其 Provider Voice Arena 盲测榜上整体排名第二,仅次于 Sonic 3.6
为什么重要
- 声音克隆门槛降至 30 秒音频,配合逐行表现力控制,大幅降低游戏配音、有声书、播客等内容的制作成本
- 100+ 语言与 2000+ 预置音色覆盖广泛的本地化与批量合成需求,Flash-Lite 版本进一步压低大规模部署成本
- 在第三方语音设计基准上的领先表现表明其与竞品(如 Hume、Cartesia Sonic)竞争中的技术位势,可能推动语音生成赛道新一轮竞争;但在盲测总榜上尚未全面登顶,实际听感优势仍待更多第三方验证
2026-09-23 ~ 2026-09-24 · 14 条相关
一手来源
- Google DeepMind 发布 Gemini 3.8 文本转语音,可 30 秒克隆声音 — Google DeepMind ·
- Google 发布 Gemini 3.8 Flash TTS 双模型,支持 100+ 语言定制声音 — GoogleAI ·
- Google 发布 Gemini 3.8 Flash TTS,发音鲁棒性登顶、语音榜第二 — ArtificialAnlys ·
- 【源头】Google DeepMind 发布 Gemini 3.8 文本转语音,可 30 秒克隆声音 — Google DeepMind · 2026-09-23
- 【源头】Google 发布 Gemini 3.8 Flash TTS 双模型,支持 100+ 语言定制声音 — GoogleAI · 2026-09-23
- Gemini 3.8 TTS 登顶 Hume 语音设计榜,Voice Arena 六语言第一 — _philschmid · 2026-09-23
- 谷歌 AI Studio 发布新语音模型:30 秒复刻自己声音,提示词即可设计音色 — ammaar · 2026-09-23
- 【源头】Google 发布 Gemini 3.8 Flash TTS,发音鲁棒性登顶、语音榜第二 — ArtificialAnlys · 2026-09-23
另有 9 条近重复转述:AI_Andrew · _philschmid · patloeber · ArtificialAnlys · OfficialLoganK · rseroter · OfficialLoganK · kimmonismus · Arindam_1729