三篇论文同指一方向:循环复用层而非加深参数,让掩码模型更高效
LucaAmb · x · 2026-09-05
diffusionllms 账号梳理了三篇方向趋同的研究:掩码/扩散语言模型不必靠加大参数变强,而可以在推理时「花深度」——复用计算来获得更深的等效网络。要点:
- LoopMDM:在每步推理中选择性循环复用 transformer 的早中层;训练时循环可产生深度扩展效应,推理时调节循环次数即可弹性扩展算力。以最多 3.3 倍更少的训练 FLOPs 匹敌同尺寸 MDM,GSM8K 上最高提升 +8.5 分。
- 另外两篇(R-MDM 等)从不同角度得出同一洞见:把「深度」从训练时固定属性变成推理时可购买的资源。
andreamiele 预告将在周一讨论 dLLM 与 Looping 结合的方向。
所属事件:三篇论文同证:循环复用算力可让掩码模型不加深不增参(2 条相关)→
「模型」频道最新
- Fable 任务成本六成花在 evals,Astra 缓存读价贵 8 倍引犹豫 — jxnlco · 2026-09-05
- Grok 网页版获全新 UI 改版,界面风格更简洁 — XFreeze · 2026-09-05
- 博主宣布 eyebench 停更 v4,转向更难基准 — adonis_singh · 2026-09-05
- Astra-max 按「每 token 智力」衡量,低推理档也远超其他模型 — adonis_singh · 2026-09-05
- Astra-max 视觉基准 eyebench-v3 得分 95%,成本仅 Sol-max 一半 — adonis_singh · 2026-09-05
- Pass@1打平:GPT 6 Astra多次采样表现不敌Fable 5.1 — zainhas · 2026-09-05