Qwen2.5-72B INT8 跑分实测:vLLM 配置与性能优化

OvertaxedOne · reddit · 2026-08-26

Reddit 用户分享了在 A40 显卡上运行 Qwen2.5-72B INT8 模型的经验。目前配置下生成速度约 25 TPS,但在 256K 上下文(KV Cache FP8)时显存占用接近极限。作者考虑切换至 INT4 以换取速度和显存空间,并询问 INT4 与 INT8 在工具调用(Hermes 模型)上的质量差异。

vLLM 启动配置参考:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →