128GB 统一内存 Strix Halo 跑本地模型:实测 Qwen 27B-35B 最好用
lebbi · reddit · 2026-09-17
作者在拥有 128GB 统一内存的 Framework Desktop(AMD Strix Halo)上折腾本地模型,分享实际体验:
- 反直觉的发现:尽管有约 90GB 富余内存,实际跑得最好、用得最多的反而是中等规模模型,如 Qwen 3.6 35B 和 Qwen 3.8 27B,用于编程效果最佳;
- 瓶颈在 CPU:算力不足以同时跑多个 agent 并保持可用速度,大内存利用率低;
- 向社区征集:大家在 Strix Halo 128GB 上都在跑什么模型,是否有更充分利用大内存的方案。
对考虑购买大内存 AIO 设备跑本地 LLM 的人有参考价值:内存大不等于要用最大模型,速度和 CPU 往往才是瓶颈。
「Infra」频道最新
- 16GB 内存硬跑 14B 模型,网友自嘲把电脑跑成了面包机 — Aggravating_Site381 · 2026-09-17
- fal 工程负责人:绝不预训练模型,推理算力才是真护城河 — jfischoff · 2026-09-17
- Meta 发布 FlashAttention-4 MXFP8 版:Blackwell 上 2.85 PFLOP/s — PyTorch · 2026-09-17
- AWS 实测 NVRx 容错训练:同步 checkpoint 曾耗掉 40% 墙钟时间 — AWS ML Blog · 2026-09-17
- Qwen 3.8 27B NVFP4 量化版在双 V100 NVLink 上跑通 40 万上下文 — jjusko20 · 2026-09-17
- NVIDIA 发布 CUDA Rust:用 Rust 原生编写 GPU 内核的两条路径 — blelbach · 2026-09-17