Nvidia 新论文:让 LLM 稀疏化提速,95% 静默神经元可被跳过
YesThisIsLion · x · 2026-09-14
转发内容介绍 Nvidia 与研究者的新论文:LLM 前馈层中约 95% 的神经元对任一给定词完全静默,模型本身天然稀疏,但现代 GPU 为密集矩阵运算设计,不规则的稀疏内存访问反而导致更慢,管理空隙的开销吃掉了节省。
论文提出自定义稀疏化方案,证明 transformer LLM 可以同时做到更稀疏、更快、更小,且不损失精度,模拟大脑按需激活神经元的效率方式。
「Infra」频道最新
- llama.cpp 合入 Maple 20B-A1B 三值 MoE,CPU 低显存跑新模型 — jacek2023 · 2026-09-14
- Claude 用量加成取消,「算力大紧缺」或已开始 — jacob_posel · 2026-09-14
- 八万亿美元数据中心豪赌遭工会抵制:暂停新建直到工人权益受保护 — nordicinst · 2026-09-14
- SK 海力士完成 HBM4 内部认证,HBM 进入定制基底裸片竞争时代 — blaizedsouza · 2026-09-14
- 一个架构改动让 KV 缓存缩小 8 倍:GQA 原理与 Llama 3 实例拆解 — blaizedsouza · 2026-09-14
- HBM 系统架构全景:从 DDR 演化到 GDDR7、PIM 与 HBF 等替代路线 — blaizedsouza · 2026-09-14