audio.cpp 0.4 新增 5 个语音模型,显存最高省 37%
Acceptable-Cycle4645 · reddit · 2026-07-24
audio.cpp 发布 0.4 版,重点是补充高质量语音模型支持,并把 GGUF 提升为项目里的一级格式。
- 新增支持包括 Higgs Audio v3 TTS 4B、Fish Audio S2 Pro、Voxtral Realtime ASR,以及两个社区模型 OuteTTS 和 VieNeu-TTS-v3。
- 项目现在支持 35 个模型家族,而且所有已发布家族都提供了 GGUF 包。
- 作者给出了 RTX 5090 上的实测:
- Higgs Audio TTS 在热启动后可达到约 8.8×–10.1× 实时;
- Fish Audio S2 Pro 约 3.1×–3.4× 实时;
- Voxtral ASR 离线约 15.7× 实时,流式首 token 延迟约 171 ms。
- 与 16-bit GGUF 相比,Q8 在部分路径上最高可快约 1.5×,峰值显存可降约 37%,但是否值得量化仍取决于具体模型。
所属事件:audio.cpp 0.4发布:新增多款语音模型并提升显存效率(2 条相关)→
「Infra」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- QuixiCore 主张原生量化内核取代先反量化再执行 — QuixiAI · 2026-07-27