Google 发布 Gemini 3.8 Live 语音模型,Willison 造出纯手写网页 Demo
Simon Willison · rss · 2026-09-16
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音(speech-to-speech)模型,形态上类似 OpenAI 的 GPT-Live 系列。
Simon Willison 让 GPT-6 Astra Extra High 读文档后帮他从零构建了一个网页 UI,可在浏览器里试用新模型:
- 可选择模型和音色预设,输入可选 system prompt,直接开始语音对话
- 支持在模型说话时随时打断
- 实现完全不依赖任何库:直连 Gemini 的 BidiGenerateContent WebSocket 端点,用 Web Audio API 的 AudioContext 同时完成录音采集与播放
这个实现思路可作为接入 Gemini 实时语音 API 的极简参考。
「模型」频道最新
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17
- 网友实验:把系统提示词「女性化」后Claude输出大变样 — lookoutitsbbear · 2026-09-17