8美元ESP32跑大模型:28.9M参数实现10 tokens/秒
FinanceYF5 · x · 2026-08-06
开发者成功在价值仅 8 美元的 ESP32-S3 微控制器上,实现了完全本地运行的大语言模型(LLM)并用于打造咖啡师 AI。
核心技术指标:
- 模型参数:28.9M(其中 25M 存储在闪存查找表中)
- 运行硬件:ESP32-S3(512KB SRAM, 8MB PSRAM, 16MB 闪存)
- 推理速度:端到端 9.88 tokens/秒,单 token 计算耗时 94.9 毫秒
- 模型大小:4-bit 量化下仅 14.9MB
技术实现:
由于微控制器的高速内存极小,开发者借鉴了 Google Gemma 3n 的 Per-Layer Embeddings 技术。通过将大部分模型权重转移至闪存,仅保留频繁访问的激活值和归一化权重在 SRAM 中,成功突破了内存瓶颈,实现了无云、无 GPU 的纯端侧 AI 推理。
「Infra」频道最新
- Cloudflare 凭借激进迭代与高频交付,正成为 AI Agent 云首选 — threepointone · 2026-08-06
- Anthropic 确认自研 AI 芯片,开出 327 万年薪招募团队 — 智东西 · 2026-08-06
- PlanetScale 揭秘:大规模并行分片如何将 PB 级数据库备份提速至 50GB/s — bibryam · 2026-08-06
- 呼吁 AI 算力去中心化:从云端回归 5000 美元的本地个性化 AGI — Dan_Jeffries1 · 2026-08-06
- 单张 GH200 跑出近万 token/s,Maple 20B 模型实测惊艳 — MaziyarPanahi · 2026-08-06
- 12GB 显存跑 Minimax 视频生成:22分钟出片实测 — Svan_Derh · 2026-08-06