开源实时流式 TTS 模型 Gepard 1.0 发布
ylankgz · reddit · 2026-07-08
团队开源实时流式 TTS 模型 Gepard 1.0(Apache 2.0),面向实时对话场景。采用流式优先设计——文本到达即开始逐帧生成音频,无需等待整句。
参数量约 5.55 亿(Qwen3.5 0.8B 主干 14 层 + Nemo NanoCodec,22.05kHz),单张 RTX 5090 上可达约 20 倍实时率、约 50ms 首音频时延,单张 RTX Pro 6000 Blackwell(96GB)支持最多 256 路并行,支持少秒级参考音频的零样本语音克隆,覆盖美/英英语、墨西哥西语、巴西葡语、荷兰语。
在 Seed-TTS-eval 上与 VoxCPM2、Fish-S2、OmniVoice、Qwen3-TTS、Echo-TTS、Chatterbox Turbo 对比,感知质量 NISQA-MOS 领先(4.25),噪声/着色/不连续项最干净;诚实权衡是流式优先设计牺牲了说话人相似度(SIM 0.585)和 WER(0.036)。
所属事件:开源实时流式TTS模型Gepard 1.0发布(2 条相关)→
「多模态」频道最新
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11