Gemini 3.8 Flash TTS 发布:〈laughs〉与|mhm|标记靠离散 codec-LM 才可行
prdeepakbabu · x · 2026-09-24
Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,主打更有表现力的语音:支持 100+ 语言自定义音色、2000+ 预置音色、逐行指导语气,并可在对话中生成〈laughs〉等自然提示与 |mhm| 这类附和插话,长时生成保持音色一致。
开发者 Deepak Babu Piskala 点出真正的技术看点:附和语(backchannel)必须在不抢话轮的前提下发出,mel-spectrogram 类 TTS 没有对应的 token 表示,只有离散 codec-LM TTS 才能让它可表示、可生成。他介绍其著作《Building Speech AI》第七章深入覆盖了相关内容——该书 12 章、320+ 页,每章配套可运行代码与 notebook,覆盖语音表示、识别(Whisper、wav2vec 2.0、Conformer 等)到生产级语音系统的工程权衡。
所属事件:Google 发布 Gemini 3.8 Flash TTS 双模型,30 秒克隆声音(27 条相关)→
「多模态」频道最新
- 开源数据集 FineVision 获 NeurIPS 接收:17M 图、200 余源 — andimarafioti · 2026-09-25
- MiniMax H3 疑似「微笑过拟合」: bored 毛毛虫视频翻车实录 — episodex86 · 2026-09-25
- 浏览器端 3D 姿势编辑器 Pose Blueprint 开放测试 — OkConfusion6667 · 2026-09-25
- Reddit 用户仅调步数与 CFG 探索 AI 绘画的独立表达 — Extreme_Nice · 2026-09-25
- 不到 20 美元训练的 LoRA 让 Qwen-Image 单图转视角 — ben_burtenshaw · 2026-09-25
- Lingbot World v2 跑到 60 FPS,世界模型或重塑游戏开发 — bingxu_ · 2026-09-25