三篇论文同证:循环复用算力可让掩码模型不加深不增参

三篇方向趋同的最新研究显示,掩码/扩散语言模型要变强不必靠加大参数规模,而可以在推理时「花深度」——通过循环复用同一层计算来获得更深的等效网络。diffusionllms 账号对此进行了梳理,相关讨论热度攀升,looped models 正成为当前研究热点,被认为指出了提升这类模型效率的一条新路径。

2026-09-05 ~ 2026-09-05 · 2 条相关