优化 GPU 调度:用 CPU 成本模型加速 Megakernel 编译

yacineMTB · x · 2026-08-04

推文讨论了编译器在 GPU 流多处理器(SMs)上调度任务的优化策略。由于实际编译 megakernel 的过程非常耗时,研究团队构建了一个仅在 CPU 上运行的成本模型。该模型能够模拟给定调度方案的执行时间,从而快速筛选出最优的候选方案,最后再对这些少量候选方案进行实际编译,大幅提升了整体优化效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →