AI 当编译器:模型直出 PTX 汇编,FlashAttention 提速 1.37x
Azaliamirh · x · 2026-10-01
一项新研究(由 cosfrancois 主导,与 EPFL 的 Charly Castes、Thomas Bourgeat 合作)提出「AI 即编译器」思路:让模型直接把高层源代码(如 Triton)翻译成底层汇编(如 PTX),再由验证器通过符号/数值分析校验功能正确性,并检查竞态、死锁等属性,无需手工构建多层 IR 和 DSL。
在 B200 上相对 Triton 基线的加速:
- FlashAttention:1.37x
- Mamba2 state forward:1.10x
新芯片的软件栈适配一直是主要瓶颈,这条路子可能改变现状。作者称后续还有更多成果。
「Infra」频道最新
- PyTorch 基金会上海大会:开源是硬件、模型与推理协同的关键通道 — PyTorch · 2026-10-01
- PyTorch 大会中国站:开源是 AI 硬件、模型与推理快速演进的关键协调机制 — PyTorch · 2026-10-01
- OpenAI 携手 Synopsys 打造 GPT-Synopsys,用专用模型做芯片设计 — BenBajarin · 2026-10-01
- Cognition 抢下 CoreWeave Vera Rubin NVL72 首单,SWE-2 吞吐提升 4.8 倍 — altryne · 2026-10-01
- ROCm 10 实测:AMD 卡跑 ComfyUI 提速超 50%,不再卡死系统 — God_Hand_9764 · 2026-10-01
- Nvidia 授权 1500 亿美元回购,被视为押注未来需求 — YvesMulkers · 2026-10-01