技术探讨:llama.cpp 为何不实现 GTT 显存卸载?
pneuny · reddit · 2026-08-20
Reddit 用户提问为何 llama.cpp 不实现 GTT (GPU-to-System RAM) 卸载。作者认为,像 mmproj 这样仅在 Prompt 处理阶段使用的层,计算是并行的,即使系统 RAM 带宽仅为显存的 1/10,瓶颈可能仍在计算而非带宽,因此理论上可利用系统 RAM 免费释放显存。相比之下,CPU Offloading 受限于 CPU 计算速度,效率较低。社区对此展开了技术层面的讨论。
「Infra」频道最新
- Unsloth 发布 Qwen2.5-72B 新量化模型:1-bit 版仅需 8GB 显存 — cephaloform · 2026-08-20
- 对比 DGX B300 与 DGX Spark:去中心化训练可能更优 — aarthir · 2026-08-20
- DeepInfra 推出 Sandboxes: 为 AI 智能体提供安全隔离的算力 — gharik · 2026-08-20
- 16 万元 RTX Pro 6000 闲置换 M5 Max 128GB?本地推理选型讨论 — aghanims-scepter · 2026-08-20
- Cloudera 推出 Anywhere Cloud,改变企业 AI 部署 — DavidLinthicum · 2026-08-20
- Fireworks 与 Baseten 成最大推理云,SpaceXAI 榜上有名 — GavinSBaker · 2026-08-20