Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用
4bTechDecode · reddit · 2026-09-18
一篇面向工程师的技术拆解,分析 Google Gemini 3.8 Live 的实时语音架构:对比传统「音频→STT→LLM→TTS」级联管线与原生音频 tokenization 的差异,说明原生方案如何实现 sub-100ms 延迟,并讨论实时工具调用的实现路径。适合做实时语音 agent 的开发者参考。
「模型」频道最新
- 通义千问发布 Qwen3.8-Omni-Flash 全模态模型 — Easy_Refrigerator280 · 2026-09-18
- 文本提示分割对比:SAM3 掩码更准,Astra 更懂语言但更慢 — kate_saenko_ · 2026-09-18
- IFM 发布 K2-Horizon-7B:扩散加速 LLM 号称无损跑至 5200 tps — Zulfiqaar · 2026-09-18
- 斯坦福 Marin 开放实验室直播训练 535B 模型,十人团队全程公开 — wandb · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18