Audio8 推出 0.1B 参数 TTS,支持 11 语种零样本克隆
alexcovo_eth · x · 2026-08-26
Audio8 发布了 0.1B 参数的预览版 TTS 模型,支持 11 种语言和零样本语音克隆。模型已在 Hugging Face 上提供 ONNX INT8 版本,可在仅约 0.4GB RAM 的 CPU 上运行,无需 PyTorch 或 CUDA。该模型输出 44.1kHz 音频,提供 OpenAI 兼容的 API,采用 Apache 2.0 开源协议。
「多模态」频道最新
- 美图 MT Lab 提出 CFT 方法,解决人像重光照身份走样问题 — jiqizhixin · 2026-08-27
- Flux.3 模型最多支持 8 张参考图实测 — R34vspec · 2026-08-27
- 实测 15 秒 768p 视频生成耗时 5 秒 — umesh_ai · 2026-08-27
- 视觉通用智能白皮书:探讨视觉模态通往 AGI 的路径 — zhenjun_zhao · 2026-08-27
- 视频生成提速300倍:Jevons悖论下的创作可能 — gorkem · 2026-08-27
- V-Rubrics:基于规则强化学习的视觉保真度 — nanyang-technological-university-singapore · 2026-08-27