16GB 显存跑 Qwen 27B 提速:热插拔投机解码开源实现

tsangberg · reddit · 2026-09-13

Reddit 用户 tsangberg 在 Raymond 的 KV cache streaming fork 基础上,进一步实现了可热插拔的投机解码,并开源为 llama.cpp-adaptive-kv-streaming。

核心思路:利用 VRAM 池在 prompt 处理与解码两个阶段的不同占用——上下文超出显存时按层从主机内存流式调入,从而获得远高于常规 llama.cpp offload 的生成速度。作者在此基础上,让 MTP / DFlash2 投机模型在显存吃紧时被「弹出」、上下文回落时再加载回来,把空闲显存用于投机解码。

作者在 5060 Ti(16GB)上用它跑 Qwen 3.8 27B UD-IQ4XS,并给出了何时弹出投机模型的页数实验曲线(图示深红/浅红对比)。该项目主要针对 16GB 显卡,但机制对更大显存的用户同样有参考价值。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →