PyTorch 用 TLX 写 JFA 内核,前向快 FA4 约 13%、反向快 50%

PyTorch · x · 2026-10-02

PyTorch 团队发布博客,介绍为 Meta 生成式广告模型 GEM 打造的注意力内核 Jagged Flash Attention(JFA)在 NVIDIA Blackwell B200 上的实现与优化。

文章展示了用高层语言写接近手写性能内核的可行性,对关注推理/训练内核优化的工程师有直接参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →