320 美元 GPU 跑 125B MoE?网友晒 22 tok/s 本地方案
cephaloform · x · 2026-09-16
网友 @spiritbuun 声称用自建的 buun-llama-cpp 方案,以 Q4 量化运行 Qwen3.8-Flash-Next(125B MoE),持续速度约 22.3 tok/s,GPU 总花费仅 320 美元(P100 单卡 80 美元),并称这是当下速度/智能/成本的帕累托前沿。
注意:帖中型号名未见官方记录,数据真实性未经证实,但若属实,这种低价二手卡跑大 MoE 模型的思路对本地部署玩家有参考价值。
「Infra」频道最新
- 开发者吐槽 Agent 沙盒定价:常驻成本是 6 美元/月 VPS 的 20 倍以上 — Aryvyo · 2026-09-16
- NVIDIA Vera CPU实测:Agent工作负载单核性能达x86竞品1.64倍 — ryanshrout · 2026-09-16
- 麦肯锡:2030 年主权 AI 市场规模将达 5000-6000 亿美元 — Beth_Kindig · 2026-09-16
- Intel CEO 陈立武现身 AI Infra Summit,喊话「拥抱 AI 而非恐惧」 — karlfreund · 2026-09-16
- Brad Gerstner:AI 交易需要营收维持陡峭增长,扩建才能继续 — markjeffrey · 2026-09-16
- 传英伟达新硬件同功耗下吞吐量提升 40% — karlfreund · 2026-09-16