Block Attention Residuals 将注意力开销降到 O(Nd)
stochasticchasm · x · 2026-07-28
Block Attention Residuals:把层切成块来降注意力开销
配图里的论文段落介绍了一种 Block Attention Residuals 结构:将模型的 L 层划分为 N 个块,每个块内部先把层输出累加成一个表示,再只在块级表示之间做注意力,而不是对所有层状态做全量注意力。
要点包括:
- 这种做法可把内存和通信开销从 O(Ld) 降到 O(Nd)。
- 还能限制推理时状态规模,让块间并行结果更容易和块内顺序部分和融合。
- 作者表示,这会显著降低推理成本。
- 经验上 N≈8 就能在不同模型尺度上恢复大部分收益。
- 对 Kimi K3,作者采用 8 个块、每块 12 层 的切分方式,若把 embedding 层也算上则共有 9 个块。
「Infra」频道最新
- vLLM 携手 DigitalOcean 上线 Kimi K3 模型 — vllm_project · 2026-07-28
- 亚马逊与微软今年各将投入约 2000 亿美元建 AI 数据中心 — fortune · 2026-07-28
- AMD 称 MI455X 推理吞吐量将达 MI355X 的 34 倍 — Beth_Kindig · 2026-07-28
- Google Cloud 为 Gemini API 和 Vertex AI 加入近实时异常告警 — rseroter · 2026-07-28
- LlamaIndex 推出 Cloudflare Worker 脚手架部署 LlamaParse — llama_index · 2026-07-28
- OpenRouter 展示同一模型的多 provider 定价与路由 — gnukeith · 2026-07-28