13M 参数语音模型跑上 5 美元 ESP32 芯片,WER 反超 Whisper-tiny
Significant-Price695 · reddit · 2026-09-30
Lokutor 团队开源 Oído:基于 NVIDIA Conformer-CTC Small(13M 参数,int8)的语音识别模型,可直接跑在仅有 8 MB PSRAM 的 ESP32-S3 上,无需 GPU/NPU。LibriSpeech WER 为 3.7/8.2,优于笔记本上运行的 Whisper tiny.en(6.3/15.9);在车、厨房、食堂等真实噪声加混响场景下平均 WER 8.4 vs 12.1。提供 livedemo.py 可用自己的麦克风实测。
「Infra」频道最新
- DeepSeek 携手华为攻芯片软件,直指英伟达护城河 — pstAsiatech · 2026-09-30
- Moroney:TensorFlow 培养了一代 ML 人,新项目该选对工具 — lmoroney · 2026-09-30
- 开源 Mac 会议记录器 LokalBot:5 个本地小模型共 6.8 GB 全离线运行 — stevyhacker · 2026-09-30
- 自部署 GLM 5.3 至少需 8 张卡,实配约 13.6 万美元起 — TheZachMueller · 2026-09-30
- 1GW 算力年利润约 400 亿美元,相当于百万辆特斯拉 Robotaxi — JOBhakdi · 2026-09-30
- 荷兰多数数据中心拒绝披露用水与耗电量数据 — Thom2503 · 2026-09-30