9 个现在就能跑的开源语音与音频 AI 项目
JafarNajafov · x · 2026-07-24
这条帖子整理了 9 个可直接上手的语音/音频 AI GitHub 仓库,覆盖了语音识别、文本转语音、声音克隆和推理加速等方向。
清单包括 Whisper、F5-TTS、Coqui TTS、RVC、Bark、OpenVoice、whisper.cpp、Faster Whisper、ChatTTS。它更像一份实用收藏夹,方便直接试跑开源音频管线,而不是某个单一模型发布。
「多模态」频道最新
- ComfyUI 新增仅模型侧 LoRA 叠加与触发词拼接节点 — boulettoxx · 2026-07-24
- AI 动画叙事靠角色一致性和分镜提示词变得可复制 — Aiden_Tech_Ai · 2026-07-24
- Google 发布可在 CPU 运行的可微 3D 头部模型 — huggingface · 2026-07-24
- Wasserman 开源影片套件扩展到 8 个应用和 MCP — bennash · 2026-07-24
- Hyper3D Rodin 正从建模走向可交互动画资产 — xiaohu · 2026-07-24
- Hyper3D BANG to Parts 可把 3D 模型拆成可编辑零件 — xiaohu · 2026-07-24