3000 美元 Strix Halo+CMP 170HX 本地方案:聚合 2000 tok/s 告别云端
Edenar · reddit · 2026-10-10
作者分享了一套约 3000 美元(当前复刻需 5-6k)的本地 LLM 工作站配置与实测数据:
- 硬件:Strix Halo(Framework Desktop 128GB)+ 阿里巴巴 500 美元捡到的 CMP 170HX 8GB,用 GitHub 上的 cmpunlocker 工具无损解锁至 64GB 显存并恢复算力;GPU 走 USB4 eGPU 扩展坞(Pcie2x4);另配 Optane P5800X 1.6TB(实测对比 SN850X 流式加载 ngram 表无提升)。
- 分工架构:Strix Halo 跑 qwen 3.8 flash next 作为主 agent,达 1600-1800 tok/s prefill、60 tok/s 生成;CMP 170HX 同时跑 2 个 qwen 3.8 27b 子 agent,各带约 200k bf16 上下文,低上下文聚合 2000 tok/s pp、150-300 tok/s tg;4 小时真实会话(720 万入/110 万出 token)平均 1747 tok/s pp、100 tok/s tg。
- 工作流:用 Pi agent,主 agent 充当架构师审查子 agent 产出,搭配 websearch/python 工具做 DevOps(ci/cd、容器部署),自称体验优于 Sonnet 4.7,略逊 Opus;约 1/100 工具调用需重试,原来一天的活现在 20 分钟搞定。
- 成本与功耗:满载约 400W,作者已完全弃用云端,认为可作过定价 Spark 的吞吐替代方案。
跨架构(AMD gfx1151 + CUDA SM80)混跑大模型在 llama.cpp 下也难以实现,是主要踩坑点。
「编程与Agent」频道最新
- 个人AI Agent开始记住工作模式并自建联系人CRM — thisiskp_ · 2026-10-10
- 创作者实测生成式模型:文本提示不是唯一交互,值得做更丰富界面 — keenanisalive · 2026-10-10
- VLM 看图能力不均,「do better」式提示很快失效 — keenanisalive · 2026-10-10
- 用「相信你自己」提示法调教 LLM 写 3D SDF 模型实测 — keenanisalive · 2026-10-10
- 不用 mesh 和 3DGS,他用 LLM 写 27KB GLSL 代码生成 3D 龙 — keenanisalive · 2026-10-10
- 多智能体框架 Swarms 发布官方 Docker 镜像,一条命令即可部署 — KyeGomezB · 2026-10-10