AI 程序化生成 FlashAttention:CuTe 分块产出可运行 CUDA 代码

vtabbott_ · x · 2026-09-14

开发者展示用程序化生成方式产出 FlashAttention 的实现,采用 NVIDIA CUTLASS 的 CuTe 分块(tiling)方案,并已生成可运行的 CUDA 代码。这意味着注意力核心算子可以被自动合成而无需人工逐步编写,是 AI/程序合成辅助 GPU kernel 开发的一个具体进展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →