13M ASR 模型跑进 ESP32-S3

wunschpunsch3D · reddit · 2026-07-21

作者分享了一个把 **1310 万参数的语音识别 Conformer** 跑到 **ESP32-S3 微控制器** 上的项目。 要点包括: - 这是 NVIDIA 小型 Conformer 模型的蒸馏+量化版本 - 模型可以放进 **14MB flash**,再加上 **256KB SRAM** 和 **4MB PSRAM** - 可以转写大约 **8 秒音频** - 早期版本转写 5 秒音频要 10 分钟;现在已经快了很多,但仍然偏慢 - 也试过 Whisper Tiny,但速度更慢,所以没有继续优化 - 芯片的 **8 位硬件加速** 让这种端侧 ML 变得可行 作者还提到,量化后在 Hugging Face ASR 基准上词错率大约上升了 3%,并认为应当更多研究效率优化,让爱好者也能在便宜硬件上跑模型。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →