Proteus 为 Qwen3 122B 定制 GPU 内核,比 vLLM 最快实现快 5.2 倍

matei_zaharia · x · 2026-09-09

Databricks 发布博客介绍 Proteus——一个为运行时实际遇到的张量形状生成专用 GPU 内核的系统,质疑为何 1B 到 1T 参数的模型要共用同一套通用内核。

关键结果:为 Qwen3 122B 生成的专用内核比 vLLM 中现有最优实现快 1.8–5.2 倍。

真正难点在验证而非生成:

这提示 AI 生成代码类工作的瓶颈正在从「生成」转向「可信验证」的工程化。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →