极客实战:在 512MB 内存的 Echo Dot 2 上跑通本地大模型
alberto_zurini · reddit · 2026-08-07
开发者成功在仅有 512MB 内存和 ARMv7 处理器的亚马逊 Echo Dot 2 上,部署了完全离线的语音助手管线,实现了本地语音解析与大模型推理。
核心技术优化:
- 模型选择:使用 28M 参数的超小型 LLM(与部分 ESP32 项目同系列),处理提示词速度约 7 tokens/s,生成速度约 4 tokens/s。
- 架构改造:放弃每次对话都冷启动 llama-cli 的做法,改为常驻 llama-server 进程,并利用 cacheprompt=true 复用稳定前缀的 KV Cache。
- 性能飞跃:通过常驻服务与缓存机制,将简单指令的响应延迟从 17 秒骤降至 2.3 秒。
- 离线语音链路:结合 Sherpa-ONNX 进行离线流式语音识别(STT),并将 LLM 的输出限制为简单的 JSON 动作指令(如控制音量、开关灯),从而绕过模型小、速度慢的劣势,实现纯本地的 IoT 语音控制。
「Infra」频道最新
- SK海力士2Q26业绩预测不及预期,HBM占比与LTA效应压低ASP涨幅 — zephyr_z9 · 2026-08-07
- 50 人团队如何自建私有 RAG 系统?Mac Mini 集群方案探讨 — rogo725 · 2026-08-07
- 谷歌 TPU v7 并未低价出售,算力硬件成本居高不下 — zephyr_z9 · 2026-08-07
- 2900美元换64G显存?开发者纠结AMD显卡升级方案 — milkipedia · 2026-08-07
- 独立开发者控诉:Meta AI 爬虫疯狂抓取,致服务器过载 — Polymarket · 2026-08-07
- 曝 DeepMind 仅获 GCP 15% 算力,引发内部资源分配担忧 — zephyr_z9 · 2026-08-07