Memory Attention 论文:用查表替代价值投影,可卸载到 CPU 省 GPU 显存
serrjoa · x · 2026-09-27
Jiale Kang 在 alphaXiv 发布论文 Memory Attention (MA),提出用「token 索引记忆」替代注意力机制中的价值投影(value projection)。
核心思路
- 不再为每个 token 动态计算全新的 value,而是按 token ID 检索一层专属记忆 M,与上下文 key 相加得到 value(V = K + M)
- M 提供可复用的 token 通用表示,K 保留上下文依赖,从而取消独立的价值投影层
关键工程特性
- 推理时归一化可折叠进记忆表,value 构造退化为「查表+加法」
- MA-Offload:把记忆表放到 CPU 并预取,原型实测约 2.08× 总参数下 GPU 参数存储减少 7.38%,延迟接近基线;SSD 卸载是下一步
- MA-Recall 方向:只保留 K 与 token ID,按需重建 value,有望消除常驻 V cache
在相同训练 token 预算、增加记忆参数的条件下,多种注意力配置上语言建模与下游平均成绩均有提升。作者受 DeepMind Engram 思路启发,认为这可能是未来模型架构的一个方向。
「Infra」频道最新
- NAND 位产能达 DRAM 22 倍,CXL 内存池化主打提升利用率 — zephyr_z9 · 2026-09-27
- 囤了三年内存暴涨5倍:64GB DDR5 套条报价升至9万卢比 — ojasvi_yadav · 2026-09-27
- 200mm 晶圆热压键合参数曝光:70kN 压力 400-450°C — jwt0625 · 2026-09-27
- 曝 OpenAI 算力告急:Pro 正变成新 Plus,Plus 降级为免费 — ns123abc · 2026-09-27
- 英国北德文郡民众抗议在联合国生物圈保护区建1.5GW AI数据中心 — nordicinst · 2026-09-27
- 月入近百万美元且环比增 36%,Bittensor 算力租赁生意跑通 — markjeffrey · 2026-09-27