BAAI 推出 MALA 注意力:128K 上下文训练延迟降 2.2 倍
BAAI · hf · 2026-09-29
BAAI 发布融合注意力原语 MALA(MassAlloc Attention):保留对全部合法因果交互的分数访问,但按归一化贡献度动态分配分数之后的计算,让注意力自己决定在哪里花算力。前向用在线 softmax 归一化器,反向复用最终归一化器推导保留支撑,训练与推理共用同一容差。
关键结果:
- 8K 等算力对比中,MALA 接近逐实例 oracle,平均遗漏质量 0.0188%(oracle 0.0182%);
- 128K 上下文 + 张量并行基准中,训练前向/反向延迟分别降至 FullAttn 的 1/2.2 和 1/3.0,推理解码延迟降至 1/1.6;
- 0.6B-14B scaling law 训练中困惑度紧跟 FullAttn,同时减少总训练 FLOPs;续训得到的 14B/32B 模型在知识、推理与长上下文检索上与 FullAttn 相当。
「Infra」频道最新
- SemiAnalysis 拆解 GLM-5.3:稀疏注意力为何没能省下 HBM 内存 — burny_tech · 2026-09-29
- 蒙特利尔 Exploit Summit 亮点:Bittensor 生态大版图一览 — markjeffrey · 2026-09-29
- Bain 测算:AI 到 2031 年需年入 6 万亿美元才能撑住算力建设 — sanjaykalra · 2026-09-29
- 实测打脸:DGX Spark 上 bf16 反而比 int8 convrot 更快,H3 视频生成差 14 秒 — dtdisapointingresult · 2026-09-29
- BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍 — BAAI · 2026-09-29
- Databricks 用 AI 智能体登顶 NVIDIA 内核榜单,总花费仅约 7 万美元 — Yuchenj_UW · 2026-09-29