PyTorch 核心开发者指出:SAC 应作用于 norm+attn/mlp 而非整个 block
ezyang · x · 2026-09-26
PyTorch 核心开发者 ezyang 讨论了 transformer 训练中 Saved Activation Checkpointing(SAC)的粒度问题。
- 传统做法是在 transformer block 粒度上应用 SAC。
- 他观察到许多 SAC 策略最终总是保存 residual add(残差相加)的结果,而这些恰是 attn/mlp 的唯一输入,因此单独对它们做 SAC 即可生效。
- 他补充修正:由于通常需要重新计算 norm,严格说应对 "norm + attn/mlp" 做 SAC,而不是只说对 "attn/mlp" 做 SAC。
所属事件:PyTorch 核心开发者:SAC 粒度可细化到单条残差相加(2 条相关)→
「研究」频道最新
- Claude 无监督跑数天,粒子物理散射振幅计算首破九圈纪录 — AnthropicAI · 2026-09-26
- Greenblatt 发文警告:潜空间推理架构将大幅推高对齐风险 — anmarasovic · 2026-09-26
- 双层优化利用无标注数据,破解分子性质预测 OOD 泛化难题 — CatAstro_Piyush · 2026-09-26
- 用 Blender 造 1 万+样本,世界模型首次系统性训练客体永久性 — _akhaliq · 2026-09-26
- 用昇腾做评测基准?开发者:不想让模型爬这种山 — xeophon · 2026-09-26
- 加拿大皇家银行揭秘 ATOM 大型交易模型,用 agentic 工作流接入 LLM — VectorInst · 2026-09-26