单卡 H200 提升 41% 吞吐:LLM 离线蒸馏新法大幅降低显存
MultiverseComputingCAI · hf · 2026-08-10
针对大模型部署受限下的知识蒸馏(KD)成本高昂问题,Multiverse Computing 提出了一套高效的蒸馏实践方案,主要包含两项系统级优化:
- 离线 Top-K Logits 缓存:将教师模型的 top-K logits 预先缓存,训练学生模型时直接对齐缓存数据。此举不仅训练损失与在线蒸馏几乎一致,还将教师模型移出显存,使单次迭代速度提升约 29%,在单张 H200 GPU 上的吞吐量最高提升 41%。
- 融合分块 KL Loss:通过避免实例化完整的词表级 logit 张量,将峰值显存消耗转化为与序列长度呈线性关系。这消除了限制上下文长度的显存峰值瓶颈,使得在单卡上训练 32,768 tokens 上下文成为可能(扩展了 4 倍)。
团队还进行了损失函数设计和序列打包的消融实验,并已开源其分块损失的具体实现。
「Infra」频道最新
- Discovered Materials 获 900 万美元融资,用 AI 挖掘高效散热芯片材料 — TechCrunch AI · 2026-08-10
- 单张RTX 3090跑百万token上下文:KVarN量化突破极限 — Anbeeld · 2026-08-10
- RTX 5090本地跑MiniMax H3:int8与nvfp4量化版怎么选? — Zerozone000 · 2026-08-10
- RTX 5090 跑 MiniMax H3 视频生成卡顿 1 小时 — Johnwick1536 · 2026-08-10
- 迁移成本增50%:南华早报解析中国AI巨头难舍英伟达 — pstAsiatech · 2026-08-10
- RTX 5090 推理飙升至 233 tok/s,推测解码效果远胜 Mac — rohanpaul_ai · 2026-08-10