UC Berkeley 提出 K-search:将 CUDA 内核优化自动迁移至苹果 MLX
berkeley_ai · x · 2026-07-30
随着 AI 硬件生态日益碎片化,将成熟平台(如 NVIDIA CUDA)的内核优化经验迁移到新硬件(如 Apple Silicon)往往需要耗费大量重写精力。
UC Berkeley 与 IBM Research 的团队联合提出了 K-search 框架(演化式内核搜索)。该工具能将 CUDA 中积累的数十载优化知识自动转化为适配苹果 MLX 框架的原生策略。实测显示,其翻译出的注意力机制代码速度达到了苹果原生实现的 0.97 倍。项目已开源。
「Infra」频道最新
- TensorSharp 引擎新增多 GPU 张量并行,显著提升本地 GGUF 推理速度 — fuzhongkai · 2026-07-30
- 英伟达开源 PyCuTe:纯 Python 实现 GPU 核心布局代数 — asdf1234_0 · 2026-07-30
- 搭载 Nvidia Thor 算力,Advantech 边缘设备跑通 GMSL 摄像头 — chrismatthieu · 2026-07-30
- OpenRouter 数据:Together 提供 Kimi K3 最低价与最高缓存命中率 — zhyncs42 · 2026-07-30
- 三星Q2营业利润飙升1800%创新高,AI芯片需求强劲 — Polymarket · 2026-07-30
- AI 算力竞赛背后的隐忧:全球电力产能扩张现状盘点 — lemire · 2026-07-30