Google DeepMind 拆解语音到语音模型:三个目标互相牵制
AI Engineer · youtube · 2026-09-15
Google DeepMind 语音到语音(Gemini Live 团队)产品负责人 Valeria Wu Fon 与工程师 Tom Ouyang 的访谈:
- 演进:2018 年前语音识别是特征提取、声学/发音/语言模型加重打分的级联;端到端模型简化了链路但只做单一任务,语气、情绪、语速仍需自行拼装。
- 原生多模态:模型直接在音频、视频、文本上联合预训练,例如用西语提问时模型会自然保留英语借词 mid century,无需任何手写规则。
- 三难张力:对话性(低延迟)、智能性(任务完成)、双向多模态(视频/屏幕/文档输入)三者此消彼长——调高思考预算,智能分上升,首音频延迟立刻恶化。
- 演示:多说话人会议实时同传、路边救援 agent 读出车牌与邮编、以及 proactive audio——模型知道背景噪音不是对它说的。
「模型」频道最新
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15
- 国产多模态模型 ZDTaichu5.0-9B 登上 Hugging Face 趋势榜 — TaichuAI · 2026-09-15
- 8GB 显存跑 10Eros 视频模型:量化变体的取舍求助 — apostrophefee · 2026-09-15
- rasbt 用 Paint 复绘实测:只看最终结果的基准有多不靠谱 — rasbt · 2026-09-15
- Cristóbal Valenzuela 试用 Solaris 后直呼:网站要重新变好玩了 — c_valenzuelab · 2026-09-15
- OpenAI 将办 GPT-6 社区之夜,伦敦场确认 model 代号 Astra — SamuelMLSmith · 2026-09-15