删掉90%权重仍能用:MIT宋寒与AI模型量化简史
JafarNajafov · x · 2026-08-05
长文回顾了 MIT 教授、NVIDIA 研究总监 Song Han(韩松)在神经网络压缩与高效计算领域的开创性贡献,指出当今所有能在本地运行的量化模型几乎都得益于他的研究。
- 早期突破:2015 年在斯坦福读博期间,他提出并实现了「深度压缩」(Deep Compression)技术,通过剪枝、量化和霍夫曼编码,将 ResNet-50 的大小从 100MB 缩减至 6MB,且几乎不损失精度,荣获 ICLR 2016 最佳论文。
- 硬件与生态:他设计的稀疏计算架构 EIE 直接启发了 NVIDIA 在 2020 年 Ampere 架构中引入稀疏张量核心(Sparse Tensor Cores)。此外,他联合创立的 DeePhi Tech 被 Xilinx(现属 AMD)收购,OmniML 则被 NVIDIA 收购。
- 大模型时代:随着 LLM 的爆发,他的团队相继发布了 SmoothQuant(解决 8-bit 量化瓶颈)和 AWQ(保护 1% 关键权重消除大部分量化误差,无需反向传播)。AWQ 荣获 MLSys 2024 最佳论文,已被 NVIDIA、Google 等头部厂商集成进核心推理栈,成功将 70B 模型搬上移动 GPU。
作者总结道,这位在博士期间致力于「删除权重」的学者,如今正领导着 NVIDIA 的高效 AI 团队,而每一台运行本地模型的设备背后,都有他论文的影子。
「Infra」频道最新
- Ollama为Mac自动开启Qwen3.5推测解码,MLX后线速大幅提升 — BTA_Labs · 2026-08-05
- Python 无 GIL 版本性能实测:CPython 与 NumPy 优化详解 — abhi9u · 2026-08-05
- 探讨Groq超高速推理:实际表现与质量是否达标? — Scared-Tip7914 · 2026-08-05
- xAI 超算中心落户孟菲斯,当地房屋库存反暴增 65% — brianrkelly · 2026-08-05
- 单台 RTX PRO 6000 实测:Qwen3.6 35B NVFP4 推理破 3000 tokens/s — max_paperclips · 2026-08-05
- Cloudflare CEO:AI智能体流量已超人类,未来将达千倍 — 0xSammy · 2026-08-05