Burkov:Transformer 十年后正把递归加回来
burkov · x · 2026-09-06
《一百页机器学习》作者 Andriy Burkov 指出一个有趣的架构轮回:2017 年《Attention is All You Need》的核心贡献是从当时 SOTA 的 LSTM+注意力架构中移除递归、只保留注意力,靠并行化训练出更大的模型;而到 2026 年,业界又在把递归重新塞回 Transformer,目标是不扩大模型规模的前提下让它更聪明。
「研究」频道最新
- NEAR AI Lean agent 全解 Putnam Bench,成本仅为次便宜方案的 1/250 — lukaszkaiser · 2026-09-06
- 俄罗斯初创 Mostik 让大模型直连隐藏状态,成本降至 1/20 — 机器之心 · 2026-09-06
- KV缓存原理详解:LLM推理中为何重要且常被误解 — techNmak · 2026-09-06
- AI 用 48 小时写 2 万行 Lean 代码,攻克 98 年未解的数学难题 — 量子位 · 2026-09-06
- 「认知地图作为思维媒介」新文分享 — abenitezburraco · 2026-09-06
- Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸 — solyarisoftware · 2026-09-06