AI 程序化生成 FlashAttention:CuTe 分块产出可运行 CUDA 代码
vtabbott_ · x · 2026-09-14
开发者展示用程序化生成方式产出 FlashAttention 的实现,采用 NVIDIA CUTLASS 的 CuTe 分块(tiling)方案,并已生成可运行的 CUDA 代码。这意味着注意力核心算子可以被自动合成而无需人工逐步编写,是 AI/程序合成辅助 GPU kernel 开发的一个具体进展。
「Infra」频道最新
- Nvidia 携手 IREN 等伙伴,2027 年前在澳建成 2GW AI 算力 — Beth_Kindig · 2026-09-14
- MiniMax 3步 Turbo LoRA 实测:RTX 5090 上 2 分钟出带音频视频 — agapes1270 · 2026-09-14
- Qwen3.8-27B NVFP4 量化横评:lm_head 精度决定 MTP 加速成色 — danielhanchen · 2026-09-14
- 马斯克:SpaceX 明年将在太空部署 Nvidia AI 计算机 — inductionheads · 2026-09-14
- 小团队训练基建 Tahuna 开源:训练推理编排一站搞定 — Monaim101 · 2026-09-14
- 外挂小模型移植 DeepSeek 架构思路,Qwen3-8B prefill 提速近一倍 — rickasaurus · 2026-09-14