Meta 发布 FlashAttention-4 MXFP8 版:Blackwell 上 2.85 PFLOP/s
PyTorch · x · 2026-09-17
Meta 工程团队为 NVIDIA Blackwell 扩展了 FlashAttention-4 的 MXFP8 支持,覆盖前向与反向 kernel、融合量化与 jagged cross-attention,并构建了带融合量化与 FP8 激活计算的端到端 jagged 模块,已在内部用于 GEM 训练。最新硬件上 LP FA4 kernel 前向达 2.85 PFLOP/s、反向 2 PFLOP/s,端到端模块最高提速 1.30×。设计与开源实现见其博客。
「Infra」频道最新
- 强化学习训练成本基准上线,高级 RL 费用首次有参照 — teortaxesTex · 2026-09-17
- PyTorch 大会公布议程:torch.compile 与自定义内核成焦点 — PyTorch · 2026-09-17
- 借助「结构化决策」思路把 DiffusionGemma 推理提速 3-10 倍 — bodonoghue85 · 2026-09-17
- MTS 发布 AI 算力栈交互式图解:从电网到芯片 rack 五层全拆解 — dr_alphalyrae · 2026-09-17
- llama.cpp 跑 Qwen3.8-Flash-Next 的 SSD N-gram 流式参数求助 — Ambitious_Fold_2874 · 2026-09-17
- 贝尔实验室如何错失微芯片:IEEE Spectrum 复盘一段技术史教训 — ArtificialOther · 2026-09-17