80 美元的 P100 能跑多大的模型?玩家晒本地推理实测数据
Mrinohk · reddit · 2026-09-21
一位玩家购入二手 NVIDIA P100(约 80 美元)准备搭建专用本地推理机,在 Reddit 征询同卡用户性能表现,并详细给出了自己的基线数据。
他现有 RX 6600 XT(8GB)+ 32GB DDR4 的组合上,用 unsloth 量化的 Qwen3.6 35BA3B UDQ4KXL 配合 MTP 可跑到生成约 30 t/s、decode 48-50 t/s,64k 全精度上下文配合 --cpu-moe,预填充在 0 上下文时约 800 t/s。
计划:这张卡将装进专用机器,腾出现任游戏+推理双职能的主机;其 agent harness 大量优化 KV cache 复用,所有工具调用走代码执行。他预期 decode 有望追平,预填充因架构老旧存疑,并计划调整 llama.cpp 的 -b/-ub 参数利用 P100 更多核心。未来还想多卡叠加,再配一个小型 gemma4 e4b 量化跑轻量任务。
「编程与Agent」频道最新
- 分类模型 Jev 全面开放,开发者实测称热度堪比 GPT-3.5 发布周 — PrajwalTomar_ · 2026-09-21
- Grok Bot x Jev 模板开源:给所有 Agent 一个快速校准分类器 — eptwts · 2026-09-21
- 2 万条编码 agent 轨迹分析:69% 差评指向代码跑不通 — arena · 2026-09-21
- DeepMind、Meta、亚马逊联合发布 135 页 AI Agent 路线图 — mdancho84 · 2026-09-21
- DeepMind、Meta、亚马逊联合发布 135 页 AI Agent 路线图 — mdancho84 · 2026-09-21
- Gemma 官方 API 被曝输出 JSON 时陷入死循环 — Aggravating-Push-207 · 2026-09-21