500美元前矿机BC-250集群跑Qwen 35B达145 tok/s,256k上下文

Ok-Breadfruit-3523 · reddit · 2026-10-11

一位本地 AI 玩家的第三次更新:用 4 块二手挖矿 BC-250 板卡(单价不到 100 美元,现在约 150 美元)组成集群,通过 2.5Gb 以太网 + Vulkan + RPC 运行 llama 推理,实现 Gemini Next Flash IQ3XXS 在 100k 上下文下 60-70 tok/s,或双实例 Qwen 3.6 35B A3B IQ4 各 145 tok/s(150k 上下文降至 100 tok/s 以下)、可用上下文扩至 258k。

借助 Claude Code 迭代优化,主要手段包括:用模型自带 MTP draft head 做多轮链式投机解码(Q20 从 61 提到 68 tok/s)、录制并重放 Vulkan 命令图(每图省 3.7-4.5ms)、针对该架构写专用内核(routed-expert top-k 等,长上下文 +7.3%)、上下文 checkpoint 在板上复制而非经协调器(665ms→18ms,prompt 提速 60%)、注意力 mask 改为每 token 一个限制(省 768MiB)等。

功耗方面满载 600-900W。下一步计划为每块板换 AIO 一体水冷解决热节流,并 3D 打印水冷盖替换纸板风道。作者指出瓶颈在延迟而非带宽,升级 m.2 网络无益。附 BC-250 文档链接。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →