8GB 游戏卡跑本地 Agent:调优后速度最高提升 9 倍
ExxploreCraft · reddit · 2026-10-06
作者用 RTX 4060 Ti(8GB)+ 64GB 内存打造本地推理机,在 Claude 协助下逐项调优,比 llama.cpp 默认配置快 2-9 倍。关键做法:
- MoE 分层卸载:专家权重放系统内存、其余放显存,比逐层卸载快得多(Qwen3.6-35B-A3B 从约 25 tok/s 提到 52-65 tok/s)
- 显示输出移到 iGPU:桌面合成占用 0.5-1.2GB 显存和 GPU 时间,移走后提速 20-30%
- 原生 Linux 优于 WSL2:同硬件再快 33-38%
- 按模型家族选择 llama.cpp 分支、KV cache 量化与 MTP 按配置调优;稠密模型几乎无调优空间,小模型全进显存(Bonsai 27B 达 36 tok/s)
开源仓库含一键安装脚本(Linux/WSL2):github.com/voxlo-dev/qwen-agent-8gb。结论:消费级 GPU 加一台专用推理机即可满足大多数本地 Agent 需求。
「Infra」频道最新
- Drax 拟烧 490 万吨木材供电数据中心,排放近两倍于盖特威克航班 — nordicinst · 2026-10-06
- 数据中心商 DayOne 递交美股 IPO:上半年营收 5.12 亿美元,净亏扩大至 7720 万 — zephyr_z9 · 2026-10-06
- Strata 宣称 6GB 显存即可实现 5090 级推理性能 — lxfater · 2026-10-06
- ComfyUI 跑 Flux:13 款 GPU 实测对比基准发布 — Ok_Contribution8157 · 2026-10-06
- ODS 一键部署本地 AI:自动检测硬件、装模型、带 Agent 与插件 — Teknium · 2026-10-06
- PlanetScale 工程师长文:从手跑 Postgres 讲透 Kubernetes 反馈循环 — bibryam · 2026-10-06