AI Agent 一下午把 CUDA 注意力内核移植到 CuTe DSL,快 1.2 倍

knowrohit07 · x · 2026-09-17

maharshii 分享文章称,其 AI agent 在一个下午内将 CUDA C++ attention 内核移植到 CuTe DSL 并完成优化:结果比原内核快 1.2 倍,比 cuDNN 快 2.8 倍。

评论中 knowrohit07 补充观点:比 DSL 和 C++ 更低层的 tensor dialect(如 MLIR)值得尽快熟悉——他直接用 MLIR 写过内核、移植过 CuTe DSL 的一部分,认为 DSL 普遍调试体验差。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →