Strix Halo 128GB 双 GPU 同跑两模型遇 OOM,参数全公开
El_90 · reddit · 2026-09-14
作者在 Strix Halo 128GB(Vulkan1)上跑 Laguna-S 2.1 Q6(GTT 占用 107G/124G),同时通过 oculink 外接 r9700(Vulkan0)跑 Qwen3.8-27B Q6,单独运行都正常,但两模型同时加载即触发内核 OOM。
- dmesg 显示 llama-server 页分配失败(GFPHIGHUSER|GFPRETRYMAYFAIL)
- 已尝试降低 context、调整 pagepoolsize、DMA32 空间
- 内核参数已设 amdiommu=off、ttm.pageslimit=32505856、amdgpu.lockuptimeout=60000
- 完整 llama.cpp 启动参数(--fit/--fit-ctx、KV 量化、--jinja、批大小等)全部贴出
作者想知道除显存外还有什么系统资源会被 llama.cpp 耗尽,向社区求助。
「Infra」频道最新
- Polymarket 开设「AI 泡沫破裂」盘口,预测 2026 年底前概率 13% — Polymarket · 2026-09-14
- François Fleuret 实测:按官方文档写 prompt,16GB 4060Ti 本地跑 MiniMax 表现出色 — francoisfleuret · 2026-09-14
- 电力缺口即智能缺口:欧洲 AI 落后的能源短板 — NinaDSchick · 2026-09-14
- AI 耗电无上限,能源贫乏国家将陷入「智能鸿沟」 — NinaDSchick · 2026-09-14
- Google Cloud Run 创造者 Steren 加盟 Vercel,执掌 Fluid 计算产品线 — RealGeneKim · 2026-09-14
- Cognichip 推物理原理 AI 模型,称可将芯片设计提速最高 100 倍 — karlfreund · 2026-09-14