Gemini 3.8 Flash TTS 发布:30 秒音频即可复刻声音
kimmonismus · x · 2026-09-24
Philipp Schmid(Google)宣布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 上线。新能力包括:
- 声音复刻:只需 30 秒音频即可克隆一个声音,也可用一句话描述生成全新声音
- 声音库:可按语言、口音、性别、音高、人设筛选
- 逐行导演式控制:对每一句台词指定风格、情绪等表现
据称 Gemini 在 Hume 的 Voice Design Benchmark 排名第一,并在 6 种语言的 Voice Arena 榜单登顶。
所属事件:Google 发布 Gemini 3.8 Flash/Flash-Lite TTS:30 秒克隆声音,覆盖 100+ 语言(14 条相关)→
「多模态」频道最新
- 用 Gemini 做音频转写+动态字幕+硬件加速渲染的完整视频工作流 — AI_Andrew · 2026-09-24
- 自制 Minimax H3 工作流:多图+音频+视频混合参考输入 — TheNeonGrid · 2026-09-24
- R2 技术拆解:动态分块适配输入类型,多时间尺度记忆维持世界一致性 — SarahAnnabels · 2026-09-24
- 求工具:给英剧字幕逐行标注说话人身份 — dtdisapointingresult · 2026-09-24
- fal 企业收入半年增逾 4 倍,算力成生成媒体最大瓶颈 — isidentical · 2026-09-24
- Seedance 2.5 + APOB 组合让 AI 网红 vlog 一条prompt拍成 30 秒短片 — aftahi_ai · 2026-09-24