Whisper 语音机器人延迟达 1.5 秒,打断还会失效
Dull_Look_2320 · reddit · 2026-07-27
做一个面向房产支持的语音助手时,作者发现把 Whisper API + LLM + TTS 串起来后,端到端延迟大约有 1.5 秒,对话体验像「对讲机」而不是自然通话。
另一个痛点是:用户插话、打断时整条链路会崩,因为当前 STT 层处理不了实时串话和说话人区分。作者想知道有没有已经能上生产的低延迟方案,或者如何避免自己从头写一大堆 VAD / chunking 逻辑。
「Infra」频道最新
- AI Shipping Labs 公开 10 场 workshop 代码,覆盖 agent 部署与向量检索 — Al_Grigor · 2026-07-27
- Observer 用本地模型监控屏幕麦克风并自动告警 — alex_verem · 2026-07-27
- 3090 加 5060 Ti 的本地 AI 机,该装什么系统和编码模型 — PolarNightProphecies · 2026-07-27
- JAX-JS 让 Kyutai Pocket TTS 在浏览器里跑到 2.5 倍实时 — dejavucoder · 2026-07-27
- Moonshot 称 Kimi-K3 今晚开放权重,需 64 张以上加速器 — heypearlai · 2026-07-27
- llmux 用一个 profile 管理 vLLM 和 llama.cpp 切换 — Available-Message509 · 2026-07-27