Rubin 用 2:4 注意力稀疏压缩降低带宽和存储
nrehiew_ · x · 2026-07-22
这条帖讲的是一种 attention 稀疏压缩 思路:
- 对每个局部 4 个元素的小组,只保留幅值最大的 2 个,并把它们的索引一起存下来,其余位置隐式置零。
- Rubin 随后可以直接在“压缩后的张量 + 索引”上做 MMA,从而减少带宽和存储开销。
- 配图进一步展示了稀疏矩阵如何被压成“非零值 + 2-bit 索引”的形式,以及这个稀疏特性如何接入 transformer 的 attention / MLP block。
「Infra」频道最新
- Kimi 联合 AMD 优化 MI355X 服务栈,TTFT 降 3.2 倍 — AnushElangovan · 2026-07-23
- TargonOS 上线机密算力,支持 GPU 和 CPU 虚拟机 — JosephJacks_ · 2026-07-23
- 云基础设施正分化为多云、混合云和主权云 — BenBajarin · 2026-07-23
- Ben Bajarin 认为 Anthropic 是 AMD GPU 布局的天然伙伴 — BenBajarin · 2026-07-23
- vLLM meetup 回归,讨论路线图、Agent 工作负载和生产服务 — vllm_project · 2026-07-23
- OpenAI 基础设施投入将达 7500 亿美元,相当于瑞典 GDP — TechCrunch AI · 2026-07-23