BAAI 推出 MALA 注意力:128K 上下文训练延迟降 2.2 倍

BAAI · hf · 2026-09-29

BAAI 发布融合注意力原语 MALA(MassAlloc Attention):保留对全部合法因果交互的分数访问,但按归一化贡献度动态分配分数之后的计算,让注意力自己决定在哪里花算力。前向用在线 softmax 归一化器,反向复用最终归一化器推导保留支撑,训练与推理共用同一容差。

关键结果:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →