Rubin 用 2:4 注意力稀疏压缩降低带宽和存储
nrehiew_ · x · 2026-07-22
这条帖讲的是一种 attention 稀疏压缩 思路:
- 对每个局部 4 个元素的小组,只保留幅值最大的 2 个,并把它们的索引一起存下来,其余位置隐式置零。
- Rubin 随后可以直接在“压缩后的张量 + 索引”上做 MMA,从而减少带宽和存储开销。
- 配图进一步展示了稀疏矩阵如何被压成“非零值 + 2-bit 索引”的形式,以及这个稀疏特性如何接入 transformer 的 attention / MLP block。
「Infra」频道最新
- RTX 5070 Ti 16GB 本地跑无审查多模态模型,求选型与量化建议 — Mystvearn_ · 2026-09-12
- 数据科学家卷精度,AI 工程师卷延迟:推理工程的入门分界线 — mdancho84 · 2026-09-12
- 开源监控平台 CheckCle 走红,自托管全栈可观测获 2.9k 星 — tom_doerr · 2026-09-12
- 太空 AI 主要做推理:有人算账「10 美元雇 200 IQ 员工,需求无限」 — JOBhakdi · 2026-09-12
- 自建编码 Agent 选沙箱:Modal 体验佳,E2B 与 Vercel 孰优 — pauliusztin · 2026-09-12
- 同批任务花 $97 还是 $13?自租 H200 比按 token 便宜 7-8 倍 — pauliusztin · 2026-09-12