技术探讨:llama.cpp 为何不实现 GTT 显存卸载?

pneuny · reddit · 2026-08-20

Reddit 用户提问为何 llama.cpp 不实现 GTT (GPU-to-System RAM) 卸载。作者认为,像 mmproj 这样仅在 Prompt 处理阶段使用的层,计算是并行的,即使系统 RAM 带宽仅为显存的 1/10,瓶颈可能仍在计算而非带宽,因此理论上可利用系统 RAM 免费释放显存。相比之下,CPU Offloading 受限于 CPU 计算速度,效率较低。社区对此展开了技术层面的讨论。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →