阿里两篇论文拆解循环 Transformer:省 33% 参数反而更准
量子位 · wechat · 2026-09-05
GPT-6 Astra 曝光后,「循环深度」(recurrent depth,让同一组 Transformer 层反复运行以加深计算)一夜爆火,但也引发监测难题与安全争议,OpenAI 首席科学家 Jakub Pachocki 被迫回应。量子位此文梳理了循环架构的核心卡点——「计算冗余」:首个 core loop 更新巨大,后续几轮 hidden state 变化迅速缩小,呈现「空转摸鱼」。
阿里及合作高校的两篇论文分别从两个角度解决这一问题:
MeSH(ICLR 2026)——管「每轮拿什么算」
- 诊断出三大症状:后续循环更新萎缩、相邻循环 CKA 相似度极高、hidden state 奇异值谱塌缩到低维;归因于「计算无分化」与「信息过载」。
- 方案:引入 Memory Buffer 记忆槽 + 每轮、每 token 独立的读写路由器,动态分流历史信息。
- 效果:Pythia-1.4B 级别减少约 33% 非嵌入参数,零样本平均准确率反而从 49.50% 升至 50.56%,额外计算开销仅约 0.014%。
SpiralFormer(EMNLP 2026)——管「每轮以什么粒度算」
- 让每轮循环处理不同分辨率的序列:先压缩到 1/8 长度看全局,再逐级放大到 1/4、1/2、全序列抠细节,并做右移防止泄露未来信息。
- Probing 实验证实模型真实学到「先全局后局部」的注意力分工,而普通 LoopedFormer 该趋势弱且不稳定。
- 效果:参数量不变、计算量从 14.08 TFLOPs 降至 13.13T,5-shot 平均准确率从 51.93% 提高到 54.37%。
- 还发现循环层占比呈 U 形曲线,30%-40% 最佳,打开了新的 Scaling 维度。
文章认为,这两篇工作补上了循环 Transformer 缺失的「分工」,为「不堆参数也能变强」的下一代高效 LLM 路线提供了实证支撑。
「模型」频道最新
- Artificial Analysis 更新榜单方法,小幅修订致排名剧变引质疑 — solyarisoftware · 2026-09-06
- Astra 饱和空间推理基准,博主直呼「LLM 视觉已解决」 — lukaszkaiser · 2026-09-06
- Nvidia 携手 CrowdStrike 打造网络安全 AI 模型 — israelavila · 2026-09-06
- Plus 用户多模型分工工作流:ASTRA 只当架构师省额度 — KhaaliSeDin · 2026-09-06
- 阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解 — solyarisoftware · 2026-09-06
- 实测打脸宣传:Astra 着色器生成竟不敌 GLM — teortaxesTex · 2026-09-06