Proteus 为 Qwen3 122B 定制 GPU 内核,比 vLLM 最快实现快 5.2 倍
matei_zaharia · x · 2026-09-09
Databricks 发布博客介绍 Proteus——一个为运行时实际遇到的张量形状生成专用 GPU 内核的系统,质疑为何 1B 到 1T 参数的模型要共用同一套通用内核。
关键结果:为 Qwen3 122B 生成的专用内核比 vLLM 中现有最优实现快 1.8–5.2 倍。
真正难点在验证而非生成:
- 团队初始测试框架中,知识与上下文管理(而非候选内核生成)消耗了大部分 token 预算;
- 验证成本高:候选内核须在真实 GPU 上隔离运行,往往不止一次;
- 验证必须严密——内核不仅要快,还须证明结果功能上可信。
这提示 AI 生成代码类工作的瓶颈正在从「生成」转向「可信验证」的工程化。
「Infra」频道最新
- ASML 获多家顶级芯片厂商承诺采用其最新光刻设备 — pstAsiatech · 2026-09-09
- 英伟达合作方 Iren CEO:AI 算力需求可能永远无法满足 — pstAsiatech · 2026-09-09
- 工信部规划:2030 年中国智算能力提至 9800 EFLOPS,翻两番 — pstAsiatech · 2026-09-09
- 消息称 Nvidia 开始采用铜-金刚石复合材料散热 — zephyr_z9 · 2026-09-09
- FT曝华为全面押注光刻产业链,年内将交付12台国产DUV光刻机 — EleanorOlcott · 2026-09-09
- Google Cloud 八月 AI 基础设施盘点:gVisor 进 Ray 集群、Filestore 上 Colossus — dl_weekly · 2026-09-09