6 张 AMD 矿卡集群跑本地 LLM:100k 上下文 28 tok/s
Ok-Breadfruit-3523 · reddit · 2026-10-02
Reddit 用户用 6 块 BC-250 矿卡(ASRock 4U12G 机箱)搭出本地 LLM 集群:4 块板跑 Qwen Next Flash IQ2XS,100k 上下文约 28 tok/s,50k 上下文 24 tok/s、约 115 ppt;另外 2 块跑 Qwen 3.6 35B Q4,60 tok/s、100k 上下文、450 ppt。全部用 llama.cpp + Vulkan,通过 1Gb 以太网 RPC 联机,进风居然靠一个装了 3 个风扇的纸箱。
「Infra」频道最新
- 传 Broadcom 拟向 Anthropic 提供至多 420 亿美元贷款买芯片 — rohanpaul_ai · 2026-10-02
- Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练 — _reachsumit · 2026-10-02
- 开发者开源 GPT-2 XL 本地复现项目,CPU 即可跑 15 亿参数老模型 — MikePFrank · 2026-10-02
- CoreWeave 推出 serverless GPU:按小时付费、无需合约,私测开放 — altryne · 2026-10-02
- 5090+5070Ti 双卡实测:显存翻倍不如想象中值 — Lordofwhut · 2026-10-02
- 8GB 显存跑视频生成:MiniMax H3 配 360 orbit LoRA 实测 — big-boss_97 · 2026-10-02