Google DeepMind 演讲:用 Gemini Live API 构建实时语音视觉 Agent
AI Engineer · youtube · 2026-10-11
Google DeepMind 开发者体验团队的 Thor Schaeff 在 AI Engineer 大会上演示如何用 Gemini 构建能实时听、看、多语言应答的 Agent。
要点
- 用 Gemini Live 配合 Nano Banana 图像模型创作绘本故事,借助有状态的 Interactions API 在多张图之间保持角色与风格一致
- Gemini 3.5 Live Translate 近实时语音翻译,支持现场听众扫码用自己的语言听讲
- AI 电台 DJ demo:语音 Agent 按需调用 Lyria 3 生成雷鬼顿音乐
- Live API 原理:有状态 WebSocket 会话,输入文本/音频/视频,流式返回音频与转写;用原生音频模型而非 STT+TTS 流水线,支持 90 种语言、打断(barge-in)、工具调用与 Google Search grounding
- 结尾在 Google AI Studio 做语音+视觉+普通话演示,合作伙伴包括 LiveKit 与 Pipecat
附 Live API、Interactions API、Live Translate、Lyria 3 开发者文档链接。
「编程与Agent」频道最新
- 给邮件 agent 加正则打分防注入:隐藏 CSS 直接扣 12 分 — kumard3 · 2026-10-12
- 本地沙箱仍是空白机会:开发者花数十小时调通远程 Agent — zeeg · 2026-10-12
- Matt Shumer 发布 Workbench:一份 Markdown 文档指挥多个 agent 协作 — mattshumer_ · 2026-10-12
- Agent 工程师最易踩坑:缓存超时让你默默烧掉预算 — brandon_galang · 2026-10-12
- 审 agent 写的 PR 怎么查?故意弄坏代码看测试挂不挂 — ITower__Education · 2026-10-12
- Matt Pocock 用 Opus 搭 chief-of-staff skill,验证环节疯狂到离谱 — mattpocockuk · 2026-10-12