vLLM Compressor v0.13.0 发布:引入 MoE 专家剪枝与任意位宽量化
vllm_project · x · 2026-08-12
vLLM 项目发布了 LLM Compressor v0.13.0 版本,重点更新包括:
- REAP 专家剪枝:支持基于校准的显著性分数,结构化移除 MoE 模型中的整个专家层,随后可对剩余部分进行 FP8 或 NVFP4 量化。
- 任意位宽量化:支持 3、5、6、7-bit 等非 2 的幂次位宽密集打包,无浪费位,并新增 16 种 WxAy 预设。
- 架构与硬件支持扩展:扩大了对 MoE 架构的线性化支持(含 Transformers v5.13.0 模型),并改进了 Intel XPU 的兼容性。
「Infra」频道最新
- NVIDIA 与微软优化 vLLM:H100 权重加载提速 7.3 倍 — NVIDIAAI · 2026-08-12
- vLLM 联手微软与英伟达,H100/A100 模型加载速度提升 7.3 倍 — vllm_project · 2026-08-12
- 数据中心建设潮遇冷:美国技工短缺成 AI 算力最大瓶颈 — coinfanking · 2026-08-12
- Bloom Energy 涨 14%,核电与燃料电池成 AI 算力新标配 — BenBajarin · 2026-08-12
- 阿里与月之暗面冲刺 10T 参数模型,算力网络内存遇瓶颈 — pstAsiatech · 2026-08-12
- Base Power 获 10 亿美元融资,剑指 AI 时代能源霸主 — Not Boring (Packy McCormick) · 2026-08-12