DeepMind 提出循环机制改进 Transformer 状态维持
burkov · x · 2026-08-25
Transformer 并行处理的高效性使其难以维持演进的内部状态,导致模型虽在深层形成正确解释,却无法及时供后续处理使用。
Google DeepMind 与 UT Austin 的论文提出了一种微小的架构改动——循环:在每个输入步骤,将深层层的内部表示混合回下一个步骤的浅层。这在不改变预训练权重的情况下创建了循环信息路径。
在 Gemma 模型上的实验显示,该方法显著改善了语言预测能力,自适应版本降低了困惑度。这表明通过简单的架构调整可以缓解 Transformer 在状态管理上的固有缺陷。
「研究」频道最新
- CoRL 2026 机器人基础模型记忆研讨会征稿 — EricLengyel · 2026-08-25
- AI 研究方向转向:替代架构人才流失至推理优化 — eigenron · 2026-08-25
- Jcode bench 推出首个不可污染的代码基准 — ycombinator · 2026-08-25
- Ai2 与 UW 招募长期 AI Agent 监督研究参与者 — ChengleiSi · 2026-08-25
- LLM能伪装成人类受访者吗?996人真实测试揭示保真度悖论 — manoelribeiro · 2026-08-25
- 通用 LLM 失败?微软论文提出企业级 Agent 架构与 FORCE-Bench — solyarisoftware · 2026-08-25