DeepMind 提出循环机制改进 Transformer 状态维持

burkov · x · 2026-08-25

Transformer 并行处理的高效性使其难以维持演进的内部状态,导致模型虽在深层形成正确解释,却无法及时供后续处理使用。

Google DeepMind 与 UT Austin 的论文提出了一种微小的架构改动——循环:在每个输入步骤,将深层层的内部表示混合回下一个步骤的浅层。这在不改变预训练权重的情况下创建了循环信息路径。

在 Gemma 模型上的实验显示,该方法显著改善了语言预测能力,自适应版本降低了困惑度。这表明通过简单的架构调整可以缓解 Transformer 在状态管理上的固有缺陷。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →