Sakana 新论文:分块训练网络,显存最多省四分之三

z_latent · reddit · 2026-08-21

Sakana AI 在 ICLR 2026 发表 DiffusionBlocks:把网络的前向过程视作扩散模型对信号去噪,从而将深度网络拆成多个块、每次只训练一个孤立块,摆脱端到端反向传播需要整网驻留显存的限制。

要点:

社区关注点是该方法能否在更大规模上成立。技术博客见 pub.sakana.ai/diffusionblocks。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →