audio.cpp 0.4 新增 5 个语音模型,显存最高省 37%
Acceptable-Cycle4645 · reddit · 2026-07-24
audio.cpp 发布 0.4 版,重点是补充高质量语音模型支持,并把 GGUF 提升为项目里的一级格式。
- 新增支持包括 Higgs Audio v3 TTS 4B、Fish Audio S2 Pro、Voxtral Realtime ASR,以及两个社区模型 OuteTTS 和 VieNeu-TTS-v3。
- 项目现在支持 35 个模型家族,而且所有已发布家族都提供了 GGUF 包。
- 作者给出了 RTX 5090 上的实测:
- Higgs Audio TTS 在热启动后可达到约 8.8×–10.1× 实时;
- Fish Audio S2 Pro 约 3.1×–3.4× 实时;
- Voxtral ASR 离线约 15.7× 实时,流式首 token 延迟约 171 ms。
- 与 16-bit GGUF 相比,Q8 在部分路径上最高可快约 1.5×,峰值显存可降约 37%,但是否值得量化仍取决于具体模型。
所属事件:audio.cpp 0.4发布:新增多款语音模型并提升显存效率(2 条相关)→
「Infra」频道最新
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11