DeepMind 发布 Gemini 3.8 TTS,原生支持多人对话与插话笑场

kastnerkyle · x · 2026-09-24

Google DeepMind 发布两款新文本转语音模型:

团队成员 MosesOh4 介绍,核心突破是原生多说话人能力:模型能自然地一起笑、插话(backchannel)与语音重叠,这在传统 TTS 上极难实现。该能力将从 TTS、NotebookLM 式双人对话走向实时语音助手。作者今年 1 月加入 DeepMind 后即参与此项目,预告后续还有更多音频生成模型。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →