阿里两篇论文拆解循环 Transformer:省 33% 参数反而更准

量子位 · wechat · 2026-09-05

GPT-6 Astra 曝光后,「循环深度」(recurrent depth,让同一组 Transformer 层反复运行以加深计算)一夜爆火,但也引发监测难题与安全争议,OpenAI 首席科学家 Jakub Pachocki 被迫回应。量子位此文梳理了循环架构的核心卡点——「计算冗余」:首个 core loop 更新巨大,后续几轮 hidden state 变化迅速缩小,呈现「空转摸鱼」。

阿里及合作高校的两篇论文分别从两个角度解决这一问题:

MeSH(ICLR 2026)——管「每轮拿什么算」

SpiralFormer(EMNLP 2026)——管「每轮以什么粒度算」

文章认为,这两篇工作补上了循环 Transformer 缺失的「分工」,为「不堆参数也能变强」的下一代高效 LLM 路线提供了实证支撑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →