LLM Compressor v0.14.0 发布,GPTQ 量化提速最高 30 倍
vllm_project · x · 2026-09-24
vLLM 项目发布 LLM Compressor v0.14.0,带来 GPTQ 自发布以来最大幅度的性能提升。
主要更新:
- 全新 Triton 量化核让 GPTQ 端到端速度约提升 15 倍;同形状层批量处理后在部分 MoE 工作负载上可达约 30 倍;旧的 eager 路径也独立提速 1.5-2 倍,并移除了 Hessian offloading。
- 扩展的 MSE/iMatrix 观察器扩大网格搜索空间(是 Fourosix 式量化策略的超集),在内部基准上 NVFP4 效果超过 GPTQ;MSE 观察器也新增 Triton 核,观测时间约快 10 倍且与 eager 路径位级一致。
- REAP 剪枝新增分布式 DDP 支持与 e-Score 修正。
- 新增对 GLM 5.3 和 Qwen3.8 的支持。
发布说明见 GitHub(vllm-project/llm-compressor,3.8k stars)。
「Infra」频道最新
- Lightmatter CEO 详谈光互连:激光器搬上 300mm 硅晶圆 — BenBajarin · 2026-09-25
- Oracle回应数据中心不可抗力通知:不等于项目延期 — ns123abc · 2026-09-25
- 100MW+数据中心电力接入要等5-10年,智库呼吁放开自建 — McDonaghMatthew · 2026-09-25
- Scaling 未到墙:从 Kaplan 到多智能体,四代扩展范式接力爆发 — gordic_aleksa · 2026-09-25
- 美银测算:Meta 2027 年自建 5-6GW 算力,斥资 2000 亿美元 — Beth_Kindig · 2026-09-25
- AWS 推出 WhisperX 深度学习容器:词级时间戳加说话人分离一键部署 — AWS ML Blog · 2026-09-25