Meta 发布 FlashAttention-4 MXFP8 版:Blackwell 上 2.85 PFLOP/s

PyTorch · x · 2026-09-17

Meta 工程团队为 NVIDIA Blackwell 扩展了 FlashAttention-4 的 MXFP8 支持,覆盖前向与反向 kernel、融合量化与 jagged cross-attention,并构建了带融合量化与 FP8 激活计算的端到端 jagged 模块,已在内部用于 GEM 训练。最新硬件上 LP FA4 kernel 前向达 2.85 PFLOP/s、反向 2 PFLOP/s,端到端模块最高提速 1.30×。设计与开源实现见其博客。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →