TPA 注意力统一 MHA/GQA/MLA,NeurIPS 2025 Spotlight
burny_tech · x · 2026-09-18
讨论焦点是 arXiv 论文《Tensor Product Attention Is All You Need》(张一凡等,姚班/Yuan 团队,已中 NeurIPS 2025 Spotlight)。核心内容:
- 提出 TPA(Tensor Product Attention),用张量分解紧凑地表示 Q/K/V,大幅压缩推理时的 KV cache;
- 与 RoPE 无缝兼容,在提升质量的同时改善内存效率;
- 基于 TPA 提出 T6 架构,在语言建模任务上超过或持平 MHA、MQA、GQA、MLA 等基线(困惑度与多项评测);
- 解码阶段的内存与计算效率使模型能在固定资源下处理更长序列。
转发讨论还指出:Tucker Attention 等张量分解注意力可视为统一框架,MHA/GQA/MLA 都是其特例,且与 FlashAttention 完全兼容。
「研究」频道最新
- SceneAgent:将 3D 采集自动转为物理仿真场景,供机器人策略训练 — hankyang94 · 2026-09-18
- LAX 发布:自然数学语言直连 Lean,可形式化复杂度类结果 — lpachter · 2026-09-18
- Fari 研究院新论文:失准 AI 无需逃逸,说服监督者即可 — DG_Rand · 2026-09-18
- 生物医学世界模型框架提出:虚拟试药、逆向干预设计与序贯规划 — marinkazitnik · 2026-09-18
- LeanReact 0.1 发布:用 Lean 类型系统表达组合正确的前端组件 — hargup13 · 2026-09-18
- Cell 刊文提出「生物医学世界模型」框架:从分子到患者的虚拟模拟 — marinkazitnik · 2026-09-18