Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆
alexcovo_eth · x · 2026-09-11
开发者实测阿里 Qwen3-TTS-12Hz-1.7B VoiceDesign:无需参考音频、无需微调,仅用自然语言描述年龄、性别、口音、麦克风距离和情绪状态即可从零合成全新音色。
基准测试(mainline llama.cpp,1.7B Q4KM):
- 纯 CPU(i7-12700H 8 线程):3.44 秒录音室级克隆音频仅 2.13 秒生成,1.61x 实时,零 VRAM,约 8GB 内存即可跑
- GPU(RTX 4060 Laptop):4.08 秒音频 1.27 秒生成,3.22x 实时,峰值 VRAM 仅 3.5GB(-c 4096)
- zero-shot 克隆惩罚几乎不存在
作者还用「宇航员系绳被拽走、半句台词突发恐慌」的压力 prompt 测试了语音中段情绪切换,效果惊艳。
「Infra」频道最新
- Claude Desktop 数据直传大厂?用 Ollama 本地模型保住隐私 — Technovangelist · 2026-09-11
- LithosAI 上线 DeepSeek-V4.1-Flash Day-0 推理,单用户 250 tokens/s — JiaZhihao · 2026-09-11
- 1 分 26 秒连续航拍 AI 视频,全流程 Mac 本地生成 — cocktailpeanut · 2026-09-11
- KV Cache 也做 QAT?技术拆解解释某模型 fp4 精度下表现更好 — stochasticchasm · 2026-09-11
- 网友猜测 Anthropic 走谷歌加部分 AWS,OpenAI 绑定微软 Azure — ericwdolan · 2026-09-11
- 英伟达:Vera Rubin 每 MW 吞吐为 Blackwell Ultra 的 50 倍,token 成本降 35 倍 — Beth_Kindig · 2026-09-11