记忆到底存在哪:RNN、Transformer 与 SSM 的工作记忆对比
Pretty_Upstairs9035 · reddit · 2026-10-07
作者从「工作记忆存在哪里」的视角重新审视三种架构的差异。
- RNN:记忆压缩在递归隐藏状态里,逐步传递,结构优雅但有瓶颈——参数量约 O(N²),而跨时间携带的状态只有 O(N),记忆与算力比例失衡。
- Transformer:走相反路线,推理时把过去表示存为 KV 缓存并对其做注意力(作者比喻为「便利贴」:每个 token 留下一个 key 用于查找、一个 value 用于记住内容)。代价是权重在推理期冻结,模型只是在管理上下文,而没有把经验固化为模型知识,形成「固定权重 + 快变 KV 缓存」的分裂。
- SSM/Mamba:回归固定大小的递归记忆,但状态结构与更新规则不同——选择性机制让保留或遗忘取决于输入 token,不过仍需把历史压缩进有限状态。
- BDH(Dragon Hatchling):将高维神经元空间中的线性注意力与低秩 GPU 实现结合,递归注意力状态是 N×D 矩阵(N≫D),相关神经元活动产生类似 Hebbian 的连接更新,让工作记忆获得「突触式」解释,但固定状态的信息容量仍是有限的。
作者不认为这会杀死 Transformer 或解决持续学习问题,而是提出:与其比拼架构,不如追问「记忆到底存在哪里」是否是更好的问题。
「研究」频道最新
- MIT论文获NeurIPS收录:给机器人时空记忆加不确定性量化 — lucacarlone1 · 2026-10-07
- NeurIPS 2026 论文 Follow the Winners:模仿优胜轨迹替代 PPO/GRPO — lawrennd · 2026-10-07
- NeurIPS 论文:为 VLM 与机器人时空记忆加入带概率保证的不确定性量化 — lucacarlone1 · 2026-10-07
- 东京大学提出 EVA:一个线性层让 VAE 重回序列生成一线 — RichmanRonald · 2026-10-07
- Pantheon 八周建百万级机器人数据集:日均新增 4.5 万任务 — hamostaf04 · 2026-10-07
- Anthropic 被曝付费请数学家验证 AI 辅助证明 — mathemagic1an · 2026-10-07