NVIDIA 开源 Model-Optimizer:量化蒸馏剪枝一站式压缩推理模型
NVIDIA · github · 2026-09-24
NVIDIA 开源的 Model-Optimizer 统一集成了量化、蒸馏、剪枝、神经架构搜索、投机解码等 SOTA 模型优化技术,可将深度学习模型压缩后对接 TensorRT-LLM、TensorRT、vLLM 等部署框架,提升推理速度。项目以 Python 编写,已获约 3900 星。
「Infra」频道最新
- Oracle 就新墨西哥数据中心发出不可抗力通知,AI 算力链生变 — AIFlow_ML · 2026-09-24
- WSJ:头部五家 2029 前 AI 资本开支将达 4.2 万亿美元,超铁路电信总和 — annbordetsky · 2026-09-24
- 150M 参数 BDH 模型挑战 Transformer:潜空间推理对话 Pathway CEO — bigdata · 2026-09-24
- stable-diffusion.cpp 纯 C/C++ 推理扩散模型,已支持 Z-Image 与 Wan — leejet · 2026-09-24
- 30B 模型推理要多少显存?量化后可从 120GB 压到 15GB — ashishllm · 2026-09-24
- 12GB 显存本地跑 Qwen-Image 2.1,开源工具实测对比 GPT 输 4:11 — Sg1000deping · 2026-09-24