三篇论文殊途同归:循环复用算力让掩码模型不加深不增参
LucaAmb · x · 2026-09-05
【转发 @jdeschena】Looped models are all the rage right now, join us on Monday for even more looping ➰➰➰
@diffusionllms 盘点了三篇方向趋同的新工作,核心洞见一致:与其加大参数量,不如复用计算,把原本在训练时固定的"深度"变成推理时可支配的资源。
- LoopMDM(选择性循环):在每个去噪步骤内反复施加 transformer 的前中部层。训练期循环带来深度扩展效应而不增加参数;推理期调节循环次数即可灵活缩放算力。与同尺寸 MDM 相比,训练 FLOPs 最多省 3.3 倍,GSM8K 最多提升 +8.5 分。
- R-MDM(递归):另一条逼近同一前沿的路线(原帖列出但未展开细节)。
作者预告周一将有更多关于 looped models 的内容。
所属事件:三篇论文同证:循环复用算力可让掩码模型不加深不增参(2 条相关)→
「研究」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- 开发者在 Minecraft 里跑通果蝇全连接组:166700 个神经元驱动苍蝇运动 — ZeroStateReflex · 2026-09-05
- Aroun 出题:把 RoPE 扩展到张量积架构 — thomasahle · 2026-09-05
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- ICML 立场论文:「无标签」不等于「无人类监督」,呼吁披露先验来源 — serrjoa · 2026-09-05
- 浙大与达摩院 VLA-Corrector:小模型审计划,机械臂成功率大涨 — 机器之心 · 2026-09-05