硬核极客:在 81KB 内存的 ESP32 上跑起 LLM
Similar_Wealth_1850 · reddit · 2026-08-09
一位开发者成功在仅有 512KB SRAM 的 ESP32 开发板上运行了一个微型 LLM,并在 HN 等社区引发热议。
技术细节:
- 模型架构:约 520 万参数的 MoE(混合专家)模型,包含 16 个专家网络,量化至 INT4。
- 内存优化:引擎将专家网络数据流式传输从 Flash 到 SRAM,每个 Token 仅运行一个专家,占用仅 81KB 内存,剩余 215KB 用于 KV Cache。
- 模型规模:包含 6 层、4 个注意力头和 128 个嵌入维度,量化后权重大小仅 3.1MB。
- 性能表现:在 ESP32 Dev Kit V1 上达到了约 5 Tokens/s 的生成速度。
此外,作者还为其加入了数学测试工具(Math Harness)以辅助解决简单方程,并引入了 Attention Sink 机制来改善上下文窗口体验。项目已在 GitHub 开源。
「Infra」频道最新
- 英伟达 Rubin Ultra 架构调整:削减 HBM 转向光互连 — zephyr_z9 · 2026-08-09
- 硬核玩家在安卓手机原生跑 SD:SDXL 出图需 20 分钟 — Silent-Paramedic4063 · 2026-08-09
- LFM 2.6B 本地跑出 260T/s:开发者实测极佳的轻量级助手体验 — Borkato · 2026-08-09
- 曝英伟达拟向AI数据中心开发商Lancium投资30亿美元 — rohanpaul_ai · 2026-08-09
- Intel至强跑大模型带宽折半?本地MoE推理性能调优实录 — GetOutOfMyFeedNow · 2026-08-09
- Ryan Dahl 推出 celld:基于 SQLite 的自托管分布式 Durable Objects — steren · 2026-08-09