MIT 提出三元线性注意力:3D 张量状态扩容长上下文记忆
Massachusetts-Institute-of-Technology · hf · 2026-10-05
MIT 团队提出 Triadic Linear Attention,推广线性注意力的状态写入方式。
- 线性注意力用 key-value 外积把 RNN 向量状态扩展为矩阵状态;该方法进一步写入 key、第二个 key 与 value 的三元外积,得到三阶(3D)张量状态,读取时用两个 query 同时收缩两个 key 轴。
- E 维第二 key 使状态容量扩大 E 倍,仅增加两个投影层,参数开销极小。
- 兼容数据依赖遗忘门、delta rule 与 chunkwise 并行训练;应用于 Gated DeltaNet 和标量门控线性注意力时,显著改善长上下文语言建模与召回能力,优于其他扩容状态的方案。
所属事件:三元线性注意力用三维张量状态扩展线性 RNN(3 条相关)→
「研究」频道最新
- Judea Pearl:逻辑与因果推断是西方科学两大支柱 — yudapearl · 2026-10-05
- 清华 NLP 推出 LexReward:三维分类体系驱动法律大模型奖励建模 — TsinghuaNLP · 2026-10-05
- 蛋白质折叠数据能让大模型更会推理:微调后 10 项基准全涨 — SJUT1 · 2026-10-05
- MotorMind:通用 VLM 免训练操控真机机器人,成功率 95% — UIUC-CS · 2026-10-05
- MBZUAI 发布 HyperBrowseComp:13 语种 423 题压测浏览 Agent — MBZUAI · 2026-10-05
- VaSE:免训练随机 KV 缓存驱逐法,缓解推理模型内存膨胀 — robinomial · 2026-10-05