三篇论文同证:循环复用算力可让掩码模型不加深不增参
三篇方向趋同的最新研究显示,掩码/扩散语言模型要变强不必靠加大参数规模,而可以在推理时「花深度」——通过循环复用同一层计算来获得更深的等效网络。diffusionllms 账号对此进行了梳理,相关讨论热度攀升,looped models 正成为当前研究热点,被认为指出了提升这类模型效率的一条新路径。
2026-09-05 ~ 2026-09-05 · 2 条相关
- 三篇论文殊途同归:循环复用算力让掩码模型不加深不增参 — LucaAmb · 2026-09-05
- 三篇论文同指一方向:循环复用层而非加深参数,让掩码模型更高效 — LucaAmb · 2026-09-05