12GB 显存跑 85GB DeepSeek-V4-Flash,解码提速至 3 tok/s
Chekhovs_Shotgun · reddit · 2026-09-27
作者在 RTX 3060 12GB + 64GB DDR5 + NVMe 的 Windows/WSL2 机器上,为 FreeToken 做了一个磁盘分层方案 Overspill,思路借鉴 Colibri 的专家分层(磁盘/RAM/VRAM)。测试模型为 DeepSeek-V4-Flash REAP-150B(FP4 专家,约 85GB)。
实测对比(同机、冷启动、贪心解码)
- 解码速度:Overspill 2.8–3.4 tok/s,llama.cpp 0.4–0.5 tok/s,Colibri 1.1–1.2 tok/s
- 6.4k 提示 TTFT:102s / 373s / 约 26 分钟
- 冷启动后首个短提示 TTFT:43s / 44s / 25s;后续短提示:10s / 40s / 18s
主要改动
- 对放不进内存的专家做内存映射,让 OS page cache 充当额外一层
- 用 madvise(WILLNEED) 让 Linux 并行大块读取每层被路由到的专家,替代逐页缺页
- 把 embedding/输出层留在内存以腾出显存
- 加大 prompt 分块,减少专家流式加载次数
- 短提示走 CPU,避免把整套专家搬进 GPU
- 磁盘专家加载约快 4 倍;另修复了 FreeToken 转换器在模型大于内存时 OOM 的问题
验证与失败尝试
- 在能装进内存的 Qwen3.6-35B-A3B 上输出与原生 FreeToken 逐字节一致
- 该 DeepSeek 模型可跑通编码测试与多轮工具调用,但未做系统评测
- 尝试从 RAM 预取下一层专家到 GPU,反而慢 9–29%,猜测是传输与计算争抢
作者强调这是单机、单请求的实验性概念验证,磁盘路径下专家计算跑在 CPU(AVX-512),速度高度依赖 CPU、内存带宽与 SSD,不应把 3 tok/s 当作通用数字。
「Infra」频道最新
- 英国电网供电不足,大型 AI 项目恐延误数年 — rvp · 2026-09-27
- FT:OpenAI 预计 2026-2030 自由现金流为负 2780 亿美元 — Beth_Kindig · 2026-09-27
- IIT 德里宣布设计出印度首款自主 micro-GPU — rvp · 2026-09-27
- 马斯克预测中国约 2-3 年内解决算力与光刻难题 — haider1 · 2026-09-27
- 开发者吐槽:99% 场景下 Vercel 已不划算,agents 可安全用 Cloudflare — generativist · 2026-09-27
- ZeroHedge 算 GPU 收益账被指用错吞吐,低估 8-10 倍 — zephyr_z9 · 2026-09-27