新 GRT 架构:参数减半可匹敌 GPT-2
burny_tech · x · 2026-08-30
论文提出“门控循环 Transformer (GRT)”,通过重复使用小型共享 Transformer 核心来解耦深度与参数数量。该架构利用基于隐藏状态的门控决定信息保留与重写,使相同权重在不同深度表现出不同行为。实验表明,在相同 FLOPs 下,3 层 GRT 匹配了 12 层 GPT-2 Small 的精度;大型模型参数减少约 62%,峰值解码内存减少 59%。此外,递归深度可作为推理时的计算超参数,通过增加递归步骤提升潜在计算能力而不增加参数量。
所属事件:门控循环 Transformer 架构实现参数减半匹敌 GPT-2(2 条相关)→
「研究」频道最新
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01
- M1 Max 30秒生成新药分子,LiteMol模型演示低成本药物发现 — CatAstro_Piyush · 2026-09-01
- 用回滚实验证明 Agent 真学习而非运气 — go_kul_07 · 2026-09-01
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01