13M ASR 模型跑进 ESP32-S3
wunschpunsch3D · reddit · 2026-07-21
作者分享了一个把 1310 万参数的语音识别 Conformer 跑到 ESP32-S3 微控制器 上的项目。
要点包括:
- 这是 NVIDIA 小型 Conformer 模型的蒸馏+量化版本
- 模型可以放进 14MB flash,再加上 256KB SRAM 和 4MB PSRAM
- 可以转写大约 8 秒音频
- 早期版本转写 5 秒音频要 10 分钟;现在已经快了很多,但仍然偏慢
- 也试过 Whisper Tiny,但速度更慢,所以没有继续优化
- 芯片的 8 位硬件加速 让这种端侧 ML 变得可行
作者还提到,量化后在 Hugging Face ASR 基准上词错率大约上升了 3%,并认为应当更多研究效率优化,让爱好者也能在便宜硬件上跑模型。
「具身」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- 机器人走到冰箱前拿出一瓶啤酒 — Darpinian · 2026-07-27
- 研究者用针织结构复现数字电路 — mtizard · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- YC 讨论具身机器人:预训练、记忆和组合行为才是关键 — ycombinator · 2026-07-27