AI Agent 一下午把 CUDA 注意力内核移植到 CuTe DSL,快 1.2 倍
knowrohit07 · x · 2026-09-17
maharshii 分享文章称,其 AI agent 在一个下午内将 CUDA C++ attention 内核移植到 CuTe DSL 并完成优化:结果比原内核快 1.2 倍,比 cuDNN 快 2.8 倍。
评论中 knowrohit07 补充观点:比 DSL 和 C++ 更低层的 tensor dialect(如 MLIR)值得尽快熟悉——他直接用 MLIR 写过内核、移植过 CuTe DSL 的一部分,认为 DSL 普遍调试体验差。
「编程与Agent」频道最新
- 让Codex审计你的skills与agents.md,适配GPT-6 Astra — nickbaumann_ · 2026-09-17
- 神秘模型 Union Alpha 登场:DeepSWE 得分 74%,超越 GPT-5.6 Sol 且更便宜 — ZeroStateReflex · 2026-09-17
- RCR 研报:AI Agent 将成网络基础设施的下一类"用户" — seankinneyRCR · 2026-09-17
- 2012年iPad mini跑Zig游戏满60帧,百行补丁复活老硬件 — banteg · 2026-09-17
- xAI 发布 Grok Build 编码智能体,由 Grok 4.6 驱动并可跨会话记忆 — ns123abc · 2026-09-17
- Yandex Research:把 KV-cache 当运行时,让 LLM 无需训练即可并发交互 — RichmanRonald · 2026-09-17