LiveKit 称 Gemma 4 31B 语音首 token 仅 192 毫秒
GlennCameronjr · x · 2026-07-30
LiveKit 转述称,语音智能体里最快的 LLM 现在是开源权重模型:Gemma 4 31B 跑在 LiveKit Inference 上,首 token 192 ms,完整说出一句话 354 ms,价格则是 每 100 万输入 token 0.40 美元(缓存后 0.20 美元)和 每 100 万输出 token 1.20 美元。
这条消息强调的是语音场景里的低延迟 + 低成本组合,而不只是模型能力本身。
「Infra」频道最新
- Nvidia多模态模型本地部署实测:单机替代云端视觉API — JFPuget · 2026-07-30
- Laguna XS登陆Apple芯片,解码速度突破140 TPS — gajesh · 2026-07-30
- Laguna XS 苹果设备推理破 140 TPS,端侧大模型迎来极速模式 — gajesh · 2026-07-30
- 7 月 AI 算力租赁签约超 500 亿美元,比特币矿场加速转型 — abhiadesai · 2026-07-30
- 26B 参数 Gemma 4 模型在 2GB RAM Mac 上运行:SSD 流式传输 — petrusenko_max · 2026-07-30
- Cloudflare Containers 推出 .exec():流式传输请求体到容器进程 — craigsdennis · 2026-07-30