Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行
amos_gyamfi · x · 2026-09-14
开发者将 82M 参数的开源 TTS 模型 Kokoro-82M(StyleTTS2 + iSTFTNet,Apache-2.0)转换为 Apple 新一代端侧运行时 Core AI 的 .aimodel 格式,提供 54 种男女声,全程本地推理,无需 API 调用和 token 费用。
要点:
- 非自回归架构:音素 + 声音/风格向量一次前向生成波形,24 kHz,英语为主
- 基于 iOS 27 / macOS 27 的 Core AI(Core ML 后继者),模型跑在 GPU 或 Neural Engine 上;同基准下 Qwen3-8B 4-bit 在 M4 Max GPU 上可达 94 tok/s
- 用法极简:一行 CoreAI.speak(text, options: .model("kokoro-82m")) 即可调用,首次使用自动下载;也可克隆 coreai-kit 的 Speak 示例(GUI + CLI)直接跑
- 完整 Swift 代码示例展示如何用 CoreAIKit 合成语音,copy-paste 可运行
「Infra」频道最新
- 自费实测 15 个 GPU 任务:成本估算平均偏高 33% — Worldly_North_7213 · 2026-09-14
- 8GB 显存跑 35B MoE 模型,投机解码到底该不该开 — Infinite-Local5435 · 2026-09-14
- 512MB 内存小板子跑 Agent:内存与执行分离实现跨机自迁移 — D777Castle · 2026-09-14
- 3000 会话 300 亿 token 实测:模型真正输出只占 0.3%,97% 输入来自缓存 — Rare_Guide_9830 · 2026-09-14
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14