开源 OmniVoice 发布:扩散架构 TTS 支持 600+ 语言零克隆语音
tom_doerr · x · 2026-09-04
k2-fsa 团队开源了 OmniVoice,一个支持 600+ 语言的大规模多语言零样本 TTS 模型,号称零样本 TTS 中语言覆盖最广,上线不久已获近万 GitHub star。
- 架构:采用类扩散语言模型的新型架构,生成高质量语音且推理速度快
- 能力:支持 SOTA 级语音克隆,以及通过性别、年龄、音高、方言口音、耳语等属性进行声音设计
- 细节控制:支持 [laughter] 等非语言符号,可通过拼音或音素做发音纠正
- 提供 Python API 与命令行工具,附训练与评测流程
「多模态」频道最新
- 网友用 GPT-6 Astra 混改 fal 视频模型,晒出原型 demo — OdinLovis · 2026-09-04
- 用户称 Ideogram 的 bbox 提示词折磨练出了 MiniMax-H3 适应力 — Nimblecloud13 · 2026-09-04
- Higgsfield 演示:文字描述直接生成 3D 场景,全管线自动渲染 — jxnlco · 2026-09-04
- 首支教程:在 Krea 2 中为 MiniMax-H3 制作完美角色设定表 — solomars3 · 2026-09-04
- 「偷取质感」GPT Image 2 提示词:产品触碰什么就染上什么材质 — aziz4ai · 2026-09-04
- 尼日利亚开发者自建 YarnGPT,补上 AI 视频缺口的本地口音语音 — saheedniyi_02 · 2026-09-04