AWS 实战教程:vLLM-Omni+SageMaker 部署 Qwen3-TTS 流式语音
AWS ML Blog · rss · 2026-09-29
AWS ML Blog 发布系列教程第一部分,讲解用 AWS vLLM-Omni 深度学习容器(DLC)在 SageMaker AI 上部署 Qwen3-TTS,构建实时语音应用:
- 架构:SageMaker 双向流式通过 HTTP/2 WebSocket(端口 8443)连接,推理 sidecar 转发到容器内 vLLM-Omni 的原生 WebSocket 路由 v1/audio/speech/stream,文本进、24 kHz PCM 音频块出,全程一条持久连接,语音可在生成完成前开始播放
- vLLM-Omni DLC:把 vLLM 扩展到文本/音频/图像/视频多模态,支持自回归+扩散多阶段异构流水线和 OpenAI 兼容 API,DLC v1.5 增加双向流式能力标签与路由中间件
- 实例池:按优先级尝试 ml.g6.xlarge,回退 g6e/g5/g4dn;注意每个池条目都要有配额,换实例类型会改变小时成本
- 上手步骤:克隆 aws-samples 示例仓库,配置执行角色(需 Python 3.12+、boto3≥1.40.0、SageMaker Runtime HTTP/2 客户端≥0.4.0),运行 deploybidistream.py 部署并自检生成 validation-output.wav,再启动 Gradio 客户端选择音色和语言生成流式语音
- 系列后续将覆盖 WhisperX、llama.cpp,第二部分讲图像/视频生成
「Infra」频道最新
- GLM 5.3 输出价一个月从 $4.4 跌到 $1.61,OpenRouter 掀推理价格战 — AccBalanced · 2026-09-29
- 平均故障间隔仅 6.5 小时:ASCI Q 超算靠中子束揪出宇宙射线元凶 — lauriewired · 2026-09-29
- 5070+5060Ti 双卡跑本地模型太慢,该换单卡 RX 7900XTX 吗 — rawdikrik · 2026-09-29
- SNI 工作原理一图看懂:CDN 和多租户服务都靠它路由 — HankYeomans · 2026-09-29
- 知名算力交易博主加盟 Compute Exchange 任交易负责人 — ns123abc · 2026-09-29
- 黑客链式利用硬编码密钥拿下 Meta 服务 root 权限并窃取云凭证 — evilsocket · 2026-09-29