DeepMind 发布 Gemini 3.8 TTS,原生支持多人对话与插话笑场
kastnerkyle · x · 2026-09-24
Google DeepMind 发布两款新文本转语音模型:
- Gemini 3.8 Flash TTS:可设计带独特口音与性格的声音
- Gemini 3.8 Flash-Lite TTS:面向效率与规模化场景,支持自建风格或官方生产级声音库
团队成员 MosesOh4 介绍,核心突破是原生多说话人能力:模型能自然地一起笑、插话(backchannel)与语音重叠,这在传统 TTS 上极难实现。该能力将从 TTS、NotebookLM 式双人对话走向实时语音助手。作者今年 1 月加入 DeepMind 后即参与此项目,预告后续还有更多音频生成模型。
「多模态」频道最新
- invideo 编辑器全靠对话驱动:一个转场效果从聊天里诞生 — aziz4ai · 2026-09-24
- Midjourney 胶片风立体人像实测:光晕与散景提示词组合 — michaelrabone · 2026-09-24
- 12GB 显存本地跑 Qwen-Image 2.1,开源工具实测对比 GPT 输 4:11 — Sg1000deping · 2026-09-24
- 日本动画师拆解 Seedance 制作动画 MV 的完整工作流 — PointmanW · 2026-09-24
- 阿里发布 Qwen-Image 2.1 ControlNet Union:单一权重支持 8 种控制条件 — fruesome · 2026-09-24
- 四模型级联出图:Recraft→nano banana pro 递进增强工作流 — aziz4ai · 2026-09-24