Qwen2.5-72B INT8 跑分实测:vLLM 配置与性能优化
OvertaxedOne · reddit · 2026-08-26
Reddit 用户分享了在 A40 显卡上运行 Qwen2.5-72B INT8 模型的经验。目前配置下生成速度约 25 TPS,但在 256K 上下文(KV Cache FP8)时显存占用接近极限。作者考虑切换至 INT4 以换取速度和显存空间,并询问 INT4 与 INT8 在工具调用(Hermes 模型)上的质量差异。
vLLM 启动配置参考:
- 模型:lued/Qwen2.5-72B-INT8-W8A16-MTP
- 关键参数:--attention-backend FLASHINFER, --quantization compressed-tensors, --kv-cache-dtype fp8e4m3, --speculative-config {"method":"mtp","numspeculativetokens":1}
- 启用前缀缓存、分块预填充和自动工具选择。
「Infra」频道最新
- 业内人士称 Apple 新品阵容性能强劲 — adrianscottcom · 2026-08-26
- 专家混合模型降低延迟需付出高昂成本 — firstadopter · 2026-08-26
- Applied Compute 发布 AC2,支持团队训练私有前沿模型 — ypatil125 · 2026-08-26
- 算力估算:CBRS 3D DRAM 晶圆达 1TB — BenBajarin · 2026-08-26
- 旧金山BART年电费6500万美元,占全州用电1/700 — cis_female · 2026-08-26
- 长鑫存储HBM良率仅25%,SK海力士与美光仍主导高端市场 — demian_ai · 2026-08-26