Kimi K3 论文详解注意力残差与分块省内存设计
suchenzang · x · 2026-07-28
Kimi K3 论文披露 Attention Residuals 与分块省内存方案
这条帖子摘出了 Kimi K3 论文里关于 Attention Residuals(AttnRes) 的核心内容:它把残差连接重新设计成对前面层输出的“注意力检索”,而不是简单累加。
主要信息包括:
- 标准残差 会把历史信息压缩到一个状态里,类似 RNN 的瓶颈。
- Full Attention Residuals 让每一层都能从所有前序层中有选择地取回表示。
- Block Attention Residuals 通过把层按块分组,只在块级表示上做注意力,从而降低内存和通信开销。
- 论文给出的结论是:分块 AttnRes 能把开销从 O(Ld) 降到 O(Nd);在一个具体示例里,显存占用可从约 15 GB 降到每设备 1.9 GB 左右,配合 chunked prefill 甚至能降到 0.3 GB 以下。
配图还对比了不同残差方案的缓存表示方式,以及它们的 I/O 成本。
所属事件:Kimi K3 技术报告解析:三轴架构与混合注意力(34 条相关)→
「Infra」频道最新
- 算力才是前沿 AI 真正难复制的护城河 — GavinSBaker · 2026-07-28
- 租 GPU 加开源模型,让 AI 月账单从 120 万降到 10 万 — kimmonismus · 2026-07-28
- 本地部署 Kimi-K3 成本极高,德媒调侃需卖肾换百万欧元 — FlorianGallwitz · 2026-07-28
- Bittensor 更新 $TAO 排放机制,61% 门槛转向高估值子网 — markjeffrey · 2026-07-28
- 高通称 NPU 延迟优势让端侧 AI Agent 更实用 — qdrant_engine · 2026-07-28
- MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB — zephyr_z9 · 2026-07-28