13M ASR 模型跑进 ESP32-S3
wunschpunsch3D · reddit · 2026-07-21
作者分享了一个把 **1310 万参数的语音识别 Conformer** 跑到 **ESP32-S3 微控制器** 上的项目。 要点包括: - 这是 NVIDIA 小型 Conformer 模型的蒸馏+量化版本 - 模型可以放进 **14MB flash**,再加上 **256KB SRAM** 和 **4MB PSRAM** - 可以转写大约 **8 秒音频** - 早期版本转写 5 秒音频要 10 分钟;现在已经快了很多,但仍然偏慢 - 也试过 Whisper Tiny,但速度更慢,所以没有继续优化 - 芯片的 **8 位硬件加速** 让这种端侧 ML 变得可行 作者还提到,量化后在 Hugging Face ASR 基准上词错率大约上升了 3%,并认为应当更多研究效率优化,让爱好者也能在便宜硬件上跑模型。
「具身」频道最新
- 机器人部署数据看似值钱,但窄场景会造出数据孤岛 — chris_j_paxton · 2026-07-21
- 中年危机下的AI自救:双3090+Qwen3.6-27b让生产力提升5倍 — Civil_Fee_7862 · 2026-07-21
- WAIC 上的人形机器人演示被形容“有点吓人” — minchoi · 2026-07-21
- 一位创作者称自己登上 NBC《Today》聊机器人对战 — chris_j_paxton · 2026-07-21
- WAIC 具身智能最落地信号:服务器工厂万台部署 — 量子位 · 2026-07-21
- 阿里 RynnBrain 1.1 把具身基础模型扩到 122B-A10B — Alibaba-DAMO-Academy · 2026-07-21