Deepgram Flux TTS 发布:支持实时流式对话,延迟低于 200ms
CodeByPoonam · x · 2026-08-17
Deepgram 正式发布 Flux TTS,这是专为实时对话设计的文本转语音模型。
核心特性:
- 流式生成:不同于传统 TTS 等待文本生成完毕,Flux 在 token 到达时即开始合成语音。
- 极低延迟:低于 200ms 的响应速度,实现真正自然的对话流。
- 对话感知:模型能读取整段对话上下文,保持情绪与语气的一致性,能处理打断和对话线索。
架构整合:Flux STT(听)和 Flux TTS(说)作为单一集成栈运行,Deepgram 负责协调听与说的时序。该产品特别适用于 AI Agent、呼叫中心和会议助手等场景。
「多模态」频道最新
- dots3-note 预览版发布:280B 开源长程代理模型 — iamrobotbear · 2026-08-17
- CapCut 内置 Seedance 2.5 视频生成,$0.06/秒免排队 — aftahi_ai · 2026-08-17
- MiniMax H3 双采样潜在上放大法:1080p 视频 — wjc_5 · 2026-08-17
- 求助:MinimaxH3 分镜生视频如何避免素描风格渗入? — danielpartzsch · 2026-08-17
- 新模型 Seedance 2.5 可一键生成 TikTok 风格视频 — aitrendz_xyz · 2026-08-17
- 趣味演示:复古风格的太空游轮广告长什么样? — Necessary-Use-3820 · 2026-08-17