RTX 3060 实测:显存分配如何改变 LLM 推理执行策略

Abhishekcur · x · 2026-08-11

作者在 RTX 3060 上使用 sglang 运行 qwen3-4b 模型进行推理性能测试,发现 GPU 显存可用量会直接影响推理引擎的模型执行方式。

在启动分配 75% 静态显存并请求 8192 个 KV tokens 时,引擎实际只分配了 731 个 tokens 的 KV cache。由于剩余显存不足(仅剩 1.93 GiB),无法满足 prefill CUDA Graph 捕获所需的最低 4.00 GiB,引擎遂禁用了该捕获并回退到 eager 模式,但 decode CUDA graph 捕获依然成功。

作者指出,这种回退是基于自动选择后端的启发式判断,而非硬性限制。接下来作者将继续从内存预算、KV cache 容量、执行策略、CUDA Graphs 到内核执行,自下而上地深入探究这些底层决策如何影响最终的延迟和吞吐量。

所属事件:实测RTX 3060显存余量直接影响LLM推理执行策略(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →