Sakana 新论文:分块训练网络,显存最多省四分之三
z_latent · reddit · 2026-08-21
Sakana AI 在 ICLR 2026 发表 DiffusionBlocks:把网络的前向过程视作扩散模型对信号去噪,从而将深度网络拆成多个块、每次只训练一个孤立块,摆脱端到端反向传播需要整网驻留显存的限制。
要点:
- 在 ViT、DiT 与 LLM 上匹配端到端训练的性能;
- 若能规模化,权重、梯度、优化器状态与激活的显存可全面节省约 3-4 倍;
- 训练更易并行、通信更少,还可能改进 Looped Transformer 训练与扩散模型推理效率。
社区关注点是该方法能否在更大规模上成立。技术博客见 pub.sakana.ai/diffusionblocks。
「研究」频道最新
- 回顾 2010 年代 Pearl 与 Imbens 的因果图模型论战 — soumitrashukla9 · 2026-08-21
- GoodfireAI 拨百万美元资助可解释性研究 — 996roma · 2026-08-21
- 智谱 SAO 论文:单采样异步 RL 稳定训练千步,超越 GRPO — teortaxesTex · 2026-08-21
- 图论教程上架 ChapterPal,可搭配 AI 导师阅读 — burkov · 2026-08-21
- NeurIPS 2026 征稿:可解释性用于科学发现研讨会 — begusgasper · 2026-08-21
- 0.63M 参数验证器媲美 7B 模型,AI 推理新极限 — jm_alexia · 2026-08-21