换掉矩阵乘法不改参数:结合代数层让 110M 模型吞吐提升 7.8%
Ilya Koziev · hf · 2026-09-29
作者不再像快速矩阵乘算法那样固定乘积、寻找更便宜的求值方式,而是直接让 Transformer 的投影层改用一种更便宜的「结合代数积」——用同一组权重块上的更稀疏交互表替代普通矩阵乘法。
要点:
- 该构造在物理块尺寸固定时,算术复杂度在矩阵维度上为二次,并受 GPU 执行的形状约束;由 Alder–Strassen 界证明在双线性秩上最优;可实现为兼容因果掩码和 KV 缓存解码的行类型矩形投影;
- 实证:用相同配方和 12.3B token 预算训练两个约 110M 参数的 decoder-only 模型,仅前馈层不同。代数模型端到端生成吞吐提升 6.2–7.8%,但三项下游指标均略低;
- 作者将其定位为小规模下的可行性与可训练性验证,留待后续研究。
「Infra」频道最新
- Lambda 算力供不应求:H100 常缺货,突发负载按小时计费为闲置买单 — YvesMulkers · 2026-09-29
- Bittensor 128 个子网中 23 个已盈利,上月 GPU 网络流水 96.4 万美元 — bittingthembits · 2026-09-29
- Firebase SDK 今晨突发故障,大量 iOS 应用集体崩溃 — pranshuchittora · 2026-09-29
- Shaw 吐槽反数据中心者:一边骂算力一边上网自相矛盾 — zealcaiden · 2026-09-29
- 模型推演 2030 年十亿 Agent 虚拟机背后的 CPU 需求与芯片商机 — AccBalanced · 2026-09-29
- Tessera 论文:检索驱动 KV 缓存复用,RAG 服务首字延迟降 3.6 倍 — _reachsumit · 2026-09-29