三篇论文同指一方向:循环复用层而非加深参数,让掩码模型更高效

LucaAmb · x · 2026-09-05

diffusionllms 账号梳理了三篇方向趋同的研究:掩码/扩散语言模型不必靠加大参数变强,而可以在推理时「花深度」——复用计算来获得更深的等效网络。要点:

andreamiele 预告将在周一讨论 dLLM 与 Looping 结合的方向。

所属事件:三篇论文同证:循环复用算力可让掩码模型不加深不增参(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →