80 美元的 P100 能跑多大的模型?玩家晒本地推理实测数据

Mrinohk · reddit · 2026-09-21

一位玩家购入二手 NVIDIA P100(约 80 美元)准备搭建专用本地推理机,在 Reddit 征询同卡用户性能表现,并详细给出了自己的基线数据。

他现有 RX 6600 XT(8GB)+ 32GB DDR4 的组合上,用 unsloth 量化的 Qwen3.6 35BA3B UDQ4KXL 配合 MTP 可跑到生成约 30 t/s、decode 48-50 t/s,64k 全精度上下文配合 --cpu-moe,预填充在 0 上下文时约 800 t/s。

计划:这张卡将装进专用机器,腾出现任游戏+推理双职能的主机;其 agent harness 大量优化 KV cache 复用,所有工具调用走代码执行。他预期 decode 有望追平,预填充因架构老旧存疑,并计划调整 llama.cpp 的 -b/-ub 参数利用 P100 更多核心。未来还想多卡叠加,再配一个小型 gemma4 e4b 量化跑轻量任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →