16GB 显存跑 Qwen 27B 提速:热插拔投机解码开源实现
tsangberg · reddit · 2026-09-13
Reddit 用户 tsangberg 在 Raymond 的 KV cache streaming fork 基础上,进一步实现了可热插拔的投机解码,并开源为 llama.cpp-adaptive-kv-streaming。
核心思路:利用 VRAM 池在 prompt 处理与解码两个阶段的不同占用——上下文超出显存时按层从主机内存流式调入,从而获得远高于常规 llama.cpp offload 的生成速度。作者在此基础上,让 MTP / DFlash2 投机模型在显存吃紧时被「弹出」、上下文回落时再加载回来,把空闲显存用于投机解码。
作者在 5060 Ti(16GB)上用它跑 Qwen 3.8 27B UD-IQ4XS,并给出了何时弹出投机模型的页数实验曲线(图示深红/浅红对比)。该项目主要针对 16GB 显卡,但机制对更大显存的用户同样有参考价值。
「编程与Agent」频道最新
- 让 Codex 边做边自查,可显著提升视觉任务产出质量 — reach_vb · 2026-09-14
- Driftproof 发布首日被审计:伪造通过、6.2% 噪声误报三大问题曝光 — maverick_man1111 · 2026-09-14
- 新论文:编码 Agent 隐层表征可提前 25 步预知编辑成败 — tomssilver · 2026-09-14
- 独立开发者求助:多智能体跑满后哪里找免费 LLM 额度 — AbstractLogic · 2026-09-14
- 笔记系统进阶:frontmatter 跑状态机、所有操作按钮化 — dSebastien · 2026-09-14
- 8个让AI智能体真正干活的GitHub开源项目清单 — Shruti_0810 · 2026-09-14