英伟达开源 CuTe 代数与编译栈,加速 AI 智能体编写底层算子

GregoryDiamos · x · 2026-08-05

英伟达(NVIDIA)正式开源了 CuTe 的核心代数,将其作为全新编译栈的一部分合并入 CUTLASS 项目。CuTe 是支撑 FlashAttention 和 PyTorch 最快内核代码的底层代数基础。

主要开源内容:

此举使得工程师只需学习一次代数逻辑,即可跨硬件代次和内核类型复用知识。同时,这也极大地利好当前正在编写真实内核代码的 AI 智能体(例如 KernelEvolve 项目)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →