回看 DeepMind 的 Grid-LSTM
prajdabre · x · 2026-07-19
作者回顾 Transformer 之前 的神经网络架构“百家争鸣”时代,并拿 Grid-LSTM(2015, DeepMind) 做例子。
他指出 Grid-LSTM 的核心是:一个 cell 不再只有单一输出和记忆状态,而是拥有多个状态,让同一组输入从多个轴向被观察并相互作用。作者把这种思路类比为“多视角的数据表示”。
他进一步联系到后来的 multi-head attention、以及“沿时间和深度轴共享参数”的想法,认为这些思路在今天看起来像是 universal/looping transformer 的前身。最后的评价是:这篇工作当年显得离谱,但现在回看会发现它非常超前。
「研究」频道最新
- 新论文提出 PoLar:动态跳过或循环 LLM 层级以优化推理 — ttkciar · 2026-07-22
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- ICML 教程探讨:优化理论在 2026 年的相关性 — srush_nlp · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22