337KB 就能开口说话:sanoTTS 把 TTS 塞进 3 美元芯片
alexcovo_eth · x · 2026-09-08
开源项目 sanoTTS(sano 在尼泊尔语中意为「小」)把神经 TTS 压到了极致:模型家族参数量仅 29.4 万到 230 万,最小模型权重只有 337KB。
关键特性:
- 可在约 $3 的 ESP32-S3 微控制器上实时运行,无需云端、无需 NPU,GPIO 接 LM386 功放即可驱动喇叭
- 浏览器内通过 WebAssembly 直接运行,文本不上传服务器
- 每个声音不到 4MB,零依赖,内置 espeak-ng 音素化器
- 提供 11 个声音、6 种语言(英语、尼泊尔语、印地语、越南语、印尼语、中文)
- 在 sub-15M 参数级别中 SCOREQ/UTMOS 评测领先
- 支持 Python、NPM、Arduino/PlatformIO
作者认为比起把模型越做越大,让 AI 跑进 337KB、让小玩具和 MCU 自己「开口说话」是更有意思的方向。GitHub 上已有约 400 star。
「Infra」频道最新
- AMX 加速下 Xeon CPU 活跃参数入 L2 缓存跑出 14572 tok/s — GregoryDiamos · 2026-09-08
- Reactor 携手 NVIDIA SANA 上线 MiniMax FastH3,视频生成首次超实时 3 倍 — flngr · 2026-09-08
- NVIDIA 推出 H3 新加速方法,社区催 ComfyUI 适配 — krigeta1 · 2026-09-08
- AI 机柜光互连供应链拆解:InP 衬底与硅光或是更干净的上游布局 — demian_ai · 2026-09-08
- 双卡 7900 XTX 跑 40B 级本地模型,X570/X870 方案可行吗 — espece-de-bon · 2026-09-08
- Hugging Face 自研 WebGPU 推理引擎亮相:实验提速 5-10 倍 — nicodotdev · 2026-09-08