13M 参数语音模型跑上 5 美元 ESP32 芯片,WER 反超 Whisper-tiny

Significant-Price695 · reddit · 2026-09-30

Lokutor 团队开源 Oído:基于 NVIDIA Conformer-CTC Small(13M 参数,int8)的语音识别模型,可直接跑在仅有 8 MB PSRAM 的 ESP32-S3 上,无需 GPU/NPU。LibriSpeech WER 为 3.7/8.2,优于笔记本上运行的 Whisper tiny.en(6.3/15.9);在车、厨房、食堂等真实噪声加混响场景下平均 WER 8.4 vs 12.1。提供 livedemo.py 可用自己的麦克风实测。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →