Qwen2.5-72B 本地推理:35 tok/s vs 65 tok/s 配置解析

LittleCelebration412 · reddit · 2026-09-01

用户对比了 Qwen2.5-72B(注:标题更正为 72B)在 RTX 3090 上的两种推理速度配置(35 tok/s vs 65 tok/s)。差异主要来自量化精度(Q5 vs Q4)、KV 缓存(Q8 vs Q4)、并发槽位(4 vs 1)以及多令牌预测(MTP)开关的设置,涉及速度与质量/显存的权衡。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →