Kimi Delta Attention 被解读为查询到键的回归规则
burny_tech · x · 2026-07-28
这条转发在讲 Kimi Delta Attention 和更广义的线性注意力机制。
核心观点是:Mamba2、Gated DeltaNet 和 Kimi Delta Attention 的差异可能没有表面上那么大,真正关键的是它们如何推导状态更新规则。作者把这种更新描述为 q kᵀ 外积的累积和;如果放到 DeltaNet 的视角里,它又很像是在做一个带 MSE loss 的 SGD 更新。换句话说,可以把这类方法理解成:训练一个把 query 映射到 key 的回归模型。
「研究」频道最新
- Cohere Labs 将在 Deep Learning Indaba 带来 Triton 教程和 AI 圆桌 — Cohere_Labs · 2026-07-29
- UltraEP 把 MoE 实时均衡带进小红书机架级推理栈 — 机器之心 · 2026-07-29
- Triangle Splatting SLAM 用可微三角形做密集 RGB-D 建图 — janusch_patas · 2026-07-29
- DLBCN 2026 面向巴塞罗那深度学习研究开放征稿 — serrjoa · 2026-07-29
- NVIDIA PDD 用 4–8 步蒸馏加速图像和视频生成 — nvidia · 2026-07-29
- TD-JEPA 从离线日志学时间进展,控制任务全面优于 LeWM — HKBU-KnowComp · 2026-07-29