Gated Recurrent Transformer:3层循环深度模型打平12层GPT-2
burny_tech · x · 2026-09-20
研究者提出 Gated Recurrent Transformer(GRT),一种循环深度架构:用固定的 prelude/coda 模块夹住一个共享核心块,迭代 R 次,借鉴门控 RNN 的思路,用轻量投影和逐元素更新门(基于隐状态、prelude 输出和每步重采样的噪声)来调制循环更新,让同一组少量层在循环中实现功能多样化,而不需要每层独占权重。
主要结果:
- 在相同训练与推理 FLOPs 下,3 层 GRT 的准确率与 12 层 GPT-2 Small 持平;
- 大规模下参数量减少 63%,峰值解码显存减少 59%;
- 在 isoFLOPS 约束下,全部 9 个按预算 scale 的单元中领先 MoR 与 heavy-tail 深度采样;
- 标准训练预算下在中大规模接近稠密模型质量,预算加倍后中规模反超。
论文:arXiv:2608.15062,作者 Amr Hegazy、Amr Alanwar、Mostafa Elhoushi。
「研究」频道最新
- 邓云天开源 0.6B PII 脱敏器:英文规格编译成神经程序,CPU 本地可跑 — yuntiandeng · 2026-09-20
- RTX 5090 上跑 Qwen 27B 直播攻开放数学难题,目标 41 组 — GuiltyBookkeeper4849 · 2026-09-20
- TabPFN-3.5 技术报告发布,刷新表格预测基准 SOTA — burny_tech · 2026-09-20
- 滑铁卢开源 ProgramAsWeights:英文描述编译成本地可跑神经程序 — yuntiandeng · 2026-09-20
- LangChain 推出 Jev 评测器:打分方差低 92-913 倍,成本仅 0.34 美元 — LangChain · 2026-09-20
- 自然语言逻辑解释器开源:Jev 负责统一,Claude 做前置转换 — narphorium · 2026-09-20