Qwen2.5-72B 本地推理:35 tok/s vs 65 tok/s 配置解析
LittleCelebration412 · reddit · 2026-09-01
用户对比了 Qwen2.5-72B(注:标题更正为 72B)在 RTX 3090 上的两种推理速度配置(35 tok/s vs 65 tok/s)。差异主要来自量化精度(Q5 vs Q4)、KV 缓存(Q8 vs Q4)、并发槽位(4 vs 1)以及多令牌预测(MTP)开关的设置,涉及速度与质量/显存的权衡。
「Infra」频道最新
- 花 6 万美元组 Mac 集群跑本地 LLM,性能仍不及 10 美元订阅 — leebase65 · 2026-09-01
- LangChain 创始人呼吁:谁来做 Agent 的开源版 Codex 浏览器? — hwchase17 · 2026-09-01
- 质疑 NVIDIA MIG 实例上限,B300 为何仍限 7 个 — StasBekman · 2026-09-01
- 预测:69% 概率美国某州将在 2026 年前实施数据中心禁令 — Polymarket · 2026-09-01
- NVIDIA Groq 3 LPX 实测:长上下文输出 3431 tokens/秒 — scaling01 · 2026-09-01
- NVLink 生态加深 NVIDIA 硬件投资壁垒 — BenBajarin · 2026-09-01