弱鸡 ARM 跑大模型:KV 缓存持久化让首 Token 提速 15 倍
Annual_Manner_5901 · reddit · 2026-08-03
作者在零成本的 Oracle 免费 ARM 机器(4核)上测试发现,CPU 推理的瓶颈在于 prefill 阶段。通过将 KV 缓存持久化到磁盘,新进程可直接读取缓存,将 3356 token 的 prefill 时间从 54.4 秄降至 3.5 秒(读取内存页缓存仅需 0.1 秒)。
踩坑与失败尝试
- 发现 speculative decoding(投机解码)与预热缓存存在冲突,导致缓存形同虚设。
- 尝试将 MoE 模型的活跃专家减半,虽然 prefill 提速 44%,但会悄悄破坏 KV 缓存导致准确率下降。
意外有效的优化
- 将输入文本重写为 label: value 格式,不仅 token 数骤降,首字响应(TTFT)大幅缩短,且事实提取准确率提升。
- 将词表从 15 万裁剪至 3.2 万,实现了 17.8% 的解码提速且完全无损。项目已开源。
「Infra」频道最新
- EdgeRazor:实现 1.88 bit 极低精度的大模型混合蒸馏新框架 — ttkciar · 2026-08-03
- 工程师提醒:部署模型应保持训练时的精度 — andrew_n_carr · 2026-08-03
- 本地部署探讨:DeepSeek 模型 KV Cache 精度对性能影响 — esw123 · 2026-08-03
- 曝 OpenAI 与英伟达商讨 2500 亿美元担保,用于建设 10GW 数据中心 — Beth_Kindig · 2026-08-03
- DeepSeek API 为何能低价盈利?模型极小致单卡吞吐量暴增 — AravSrinivas · 2026-08-03
- 算力成最大瓶颈,新兴大模型公司或被迫开源合作 — gorkem · 2026-08-03