用脚本优化 llama.cpp 双 GPU 显存分配提升上下文
ea_man · reddit · 2026-08-31
作者分享了一种优化 llama.cpp 在双 GPU 下显存分配的方法。常规按比例(如 0.6, 0.4)分配不够精确,通过手动调整 --override-tensor 移动特定张量,可将 Qwen 模型的上下文长度从 110848 提升至 139776。作者提供了自动探测最佳组合的脚本工具,支持 ROCm 和 Vulkan,并给出了在 KV 缓存保存下进行测试的工作流。
「Infra」频道最新
- drskill 工具发布:像 brew doctor 一样检查 Agent 上下文与 MCP 配置 — dbreunig · 2026-08-31
- SK海力士称2027年AI内存需求将暴增60-100% — Beth_Kindig · 2026-08-31
- Carnot 与 Abacus:可优化成本的企业级 Agent 查询系统 — lateinteraction · 2026-08-31
- 纯 Rust 实现视觉定位库 visloc-rs,精度超 COLMAP — rsasaki0109 · 2026-08-31
- 佐治亚州拟建 Google 数据中心,税收将覆盖居民房产税 — robleclerc · 2026-08-31
- 谷歌亚马逊等注资电力公司,降低居民电费 — SydSteyerhart · 2026-08-31