Burkov:Transformer 十年后正把递归加回来

burkov · x · 2026-09-06

《一百页机器学习》作者 Andriy Burkov 指出一个有趣的架构轮回:2017 年《Attention is All You Need》的核心贡献是从当时 SOTA 的 LSTM+注意力架构中移除递归、只保留注意力,靠并行化训练出更大的模型;而到 2026 年,业界又在把递归重新塞回 Transformer,目标是不扩大模型规模的前提下让它更聪明。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →