13M ASR 模型跑进 ESP32-S3
wunschpunsch3D · reddit · 2026-07-21
作者分享了一个把 1310 万参数的语音识别 Conformer 跑到 ESP32-S3 微控制器 上的项目。
要点包括:
- 这是 NVIDIA 小型 Conformer 模型的蒸馏+量化版本
- 模型可以放进 14MB flash,再加上 256KB SRAM 和 4MB PSRAM
- 可以转写大约 8 秒音频
- 早期版本转写 5 秒音频要 10 分钟;现在已经快了很多,但仍然偏慢
- 也试过 Whisper Tiny,但速度更慢,所以没有继续优化
- 芯片的 8 位硬件加速 让这种端侧 ML 变得可行
作者还提到,量化后在 Hugging Face ASR 基准上词错率大约上升了 3%,并认为应当更多研究效率优化,让爱好者也能在便宜硬件上跑模型。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11