Qwen3-TTS 上架 SageMaker:几秒参考音频即可零训练克隆声音
AWS ML Blog · rss · 2026-09-26
AWS 宣布 Qwen3-TTS-12Hz-1.7B-Base 登陆 Amazon SageMaker JumpStart,可部署为托管实时推理端点,实现零训练语音克隆:仅需几秒参考录音加转写文本,即可用目标说话人的音色合成任意文本。
- 模型能力:覆盖中英日韩德法俄葡西意 10 种语言,支持跨语言克隆(保留说话人身份)与流式低延迟生成;另有固定音色的 CustomVoice 变体和 Qwen3-ASR-1.7B。
- 部署要点:单张 L4(ml.g6.4xlarge,24GB)即可跑 1.7B 模型;talker 与 code2wav 两阶段共享 GPU,需把 vLLM 的 SMVLLMGPUMEMORYUTILIZATION 设为 0.45 避免启动 OOM。
- 优势:自托管可控成本、数据不出 AWS、支持按需适配微调,适用于内容本地化、客服品牌语音、有声书与实时语音 agent 等场景。
「Infra」频道最新
- 1Cat-vLLM 让十年前的 V100 再战:Qwen3.6-35B 实测数据公布 — Miserable-Dare5090 · 2026-09-26
- 爆料称 DeepSeek 用 NVIDIA 游戏卡跑小模型推理,异构算力成焦点 — teortaxesTex · 2026-09-26
- 智能价格每年暴跌 13 倍,博主预测明年笔记本可跑 Opus 级模型 — LeviTurk · 2026-09-26
- 穆迪警告:Anthropic 与 OpenAI 表外债务已达 2.5 万亿美元 — SumitGup · 2026-09-26
- SemiAnalysis 绘制中国 60 余家运营商、1000+ 数据中心算力地图 — zephyr_z9 · 2026-09-26
- 托管都在降价,唯独审核成本暴涨:LessWrong 年烧百万美元 — jd_pressman · 2026-09-26