320 美元 GPU 跑 125B MoE?网友晒 22 tok/s 本地方案

cephaloform · x · 2026-09-16

网友 @spiritbuun 声称用自建的 buun-llama-cpp 方案,以 Q4 量化运行 Qwen3.8-Flash-Next(125B MoE),持续速度约 22.3 tok/s,GPU 总花费仅 320 美元(P100 单卡 80 美元),并称这是当下速度/智能/成本的帕累托前沿。

注意:帖中型号名未见官方记录,数据真实性未经证实,但若属实,这种低价二手卡跑大 MoE 模型的思路对本地部署玩家有参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →