优化 GPU 调度:用 CPU 成本模型加速 Megakernel 编译
yacineMTB · x · 2026-08-04
推文讨论了编译器在 GPU 流多处理器(SMs)上调度任务的优化策略。由于实际编译 megakernel 的过程非常耗时,研究团队构建了一个仅在 CPU 上运行的成本模型。该模型能够模拟给定调度方案的执行时间,从而快速筛选出最优的候选方案,最后再对这些少量候选方案进行实际编译,大幅提升了整体优化效率。
「Infra」频道最新
- Node 22 用 node --run 替代 npm run 可省 48MB 内存 — DanielLockyer · 2026-08-04
- CoreWeave计划在印尼建设首批亚太数据中心,总功率360MW — dinabass · 2026-08-04
- MiniMax H3 速度实测:4080 显卡 3 分钟生成 5 秒高清视频 — Radyschen · 2026-08-04
- 解析 mxfp8 量化下的转置痛点与显存优化策略 — dejavucoder · 2026-08-04
- Bittensor 推出 SayGm:一个 API 密钥调用 38 个主流大模型 — bittingthembits · 2026-08-04
- 算力禁令或致数据中心建设放缓,光模块需求激增 — zephyr_z9 · 2026-08-04