不足20元CPU跑通Qwen3.5-0.8B,内存占用低于512MiB
buryhuang · reddit · 2026-08-12
开发者成功在 2017 年发布、售价 10-20 美元的 Amlogic A113X 芯片(四核 Cortex-A53,无 NPU/GPU)上运行了 Qwen3.5-0.8B 模型。
- 性能表现:在 ARC-Easy 的 5 个测试用例中答对 4 题。端侧推理速度达到 Prefill 2.92 tok/s,Steady decode 1.82 tok/s。
- 资源占用:峰值内存(Peak RSS)仅 490 MiB,未使用虚拟内存,CPU 占用约 334%(4核)。
- 技术实现:作者手写了定制的 C 运行时,编译为单一静态二进制文件,抛弃了 Python 和 llama.cpp。核心思路是针对特定 CPU 提前编译固定模型,而非使用通用运行时。
- 工程洞察:解码吞吐量受限于内存带宽除以每个 token 的字节数,这与 GPU 无关。作者指出,目前该方案在实现 4.42 倍的内核加速后仍受限于算力,说明还有优化空间。作为对比,该模型在 M3 Pro 上使用通用 C 运行时的解码速度为 2.39 tok/s,这颗廉价芯片达到了其 75% 的水平。
作者认为,大量推理任务其实并不需要 GPU,现有部署在外的低配硬件(如智能家居网关)完全有能力直接运行模型。
「Infra」频道最新
- 纯 CPU 本地 OCR 横评:速度与精度的工程权衡 — coolbro1001 · 2026-08-12
- MOSS-VL 推出量化版本,24GB 显存即可本地跑多模态 — huggingface · 2026-08-12
- CuteDSL 4.7.0 发布:支持显式主机端 TMA 创建 — snowclipsed · 2026-08-12
- 美参议院拟对 AI 数据中心征收新消费税 — pstAsiatech · 2026-08-12
- Nebius Q2营收暴涨454%,算力拍卖价达每兆瓦4至5千万美元 — firstadopter · 2026-08-12
- 英伟达开源 Switchyard:专为高效LLM路由设计的Rust框架 — NVIDIA-NeMo · 2026-08-12