294k 参数 TTS 跑进 337KB,可在 3 美元单片机上合成语音
Affectionate_Hat_585 · reddit · 2026-09-04
开发者发布开源 TTS 模型家族 sanoTTS,主打极限小型化:
- 最小模型仅 294k 参数(int8 量化后 337KB),能在无 NPU、512KB SRAM 的 3 美元 MCU 上运行;ESP32 上 RTF 0.225,即 1 秒生成 4 秒音频
- 家族参数量 294k–2.2m,11 种音色、6 种语言;作者称比 kokoro 小 1000 倍、比 voxtral 小 9000 倍,是「最小的完整神经网络 TTS」,Whisper 词错率约 2%
- 1.51m 版本 SCOREQ 4.13、UTMOS 4.10,在 SCOREQ 上胜过参数量大 3 倍的 Inflect Nano 和 10 倍的 KittenTTS
- 提供 WebAssembly 网页 demo、npm 包和扩展新语言/音色的配方;代码与权重在 GitHub/HF 开源
「多模态」频道最新
- 网友用 GPT-6 Astra 混改 fal 视频模型,晒出原型 demo — OdinLovis · 2026-09-04
- 用户称 Ideogram 的 bbox 提示词折磨练出了 MiniMax-H3 适应力 — Nimblecloud13 · 2026-09-04
- Higgsfield 演示:文字描述直接生成 3D 场景,全管线自动渲染 — jxnlco · 2026-09-04
- 首支教程:在 Krea 2 中为 MiniMax-H3 制作完美角色设定表 — solomars3 · 2026-09-04
- 「偷取质感」GPT Image 2 提示词:产品触碰什么就染上什么材质 — aziz4ai · 2026-09-04
- 尼日利亚开发者自建 YarnGPT,补上 AI 视频缺口的本地口音语音 — saheedniyi_02 · 2026-09-04