WaveNet 发表十周年:作者回顾语音合成从波形生成到多模态 LLM
heiga_zen · x · 2026-09-09
Google 语音合成研究者 Heiga Zen 撰文纪念 WaveNet 发布十周年。2016 年他与 DeepMind 研究者合作推出 WaveNet,以直接生成原始语音波形的方法取代当时的拼接式与统计参数式合成。
十年演进脉络:
- Tacotron 等编码器-解码器模型实现文本到声学特征的端到端生成
- VITS、NaturalSpeech 等模型绕过中间表示,直接输出高质量波形
- AudioLM、VALL-E 借 SoundStream 将语音 token 化并入 LLM 框架
- 如今以 Gemini 为代表的多模态 LLM 已能无缝融合多模态信息生成自然对话
他展望下一个十年:更精细的上下文与情感表达、超低延迟对话、与机器人的整合。
所属事件:WaveNet发表十周年:作者回顾语音合成演进(2 条相关)→
「多模态」频道最新
- AI 虚拟网红出镜驱虫剂广告,拟真效果引围观 — AIandDesign · 2026-09-09
- 作者实测多款 SD checkpoint 与采样器组合,附 JuggernautXL v8 参数 — NickPassig · 2026-09-09
- OpenAI 发布 ChatGPT Images 2.5:更快、更清晰、支持评论式局部改图 — dkundel · 2026-09-09
- OpenAI 发布 ChatGPT Images 2.5,生成提速最高 50% 并新增 Sketch 手绘参考 — Polymarket · 2026-09-09
- ChatGPT Images 2.5 宣传片里,女子让 AI 设计纹身并真纹在了手臂上 — yvgh233 · 2026-09-09
- 用 Codex+GPT-5 搭出像素画动画网站,坐等 Gemini 3.0 Pro 实测 — Angaisb_ · 2026-09-09