Meta/Stanford 严格版评测:七个前沿模型写 CUDA kernel 无一跑赢 PyTorch
lmoroney · x · 2026-10-03
Meta 与 Stanford 研究者发布 KernelBench-Verified,对 LLM 生成的 GPU kernel 做了比原版 KernelBench 严格得多的评估(代码开源:facebookresearch/kernelbenchverified)。
更严格的协议设计:
- 以开启 TF32 的 PyTorch 为基线,对应现代 GPU 上实践者的真实设置。
- 增加四分布的隐藏正确性测试,专抓 reward hacking。
- 追踪峰值内存。
结果:
- 在新协议下,被测的七个前沿模型平均没有一个超过 PyTorch。
- 最好的 GPT-5.5 几何平均加速约 0.88x;而在原版宽松协议下同一模型的数字约 1.43x——差距揭示基线与测试设计对「加速」结论影响巨大。
作者的启示:任何 kernel 加速宣称都应当作系统问题审视——基线是什么、测试是什么、在真实设置下是否依然更快。
「模型」频道最新
- IFM 开源 K2-Type-0.9B:0.9B 决策模型单次前向输出校准概率 — HongyiWang10 · 2026-10-03
- 前 Meta 研究员加入 Prime Intellect,将参与打造 INTELLECT-4 开源模型 — willcb · 2026-10-03
- Claude 应用内测头像自定义功能,开始逐步推送 — testingcatalog · 2026-10-03
- GPT-6.1 Sol 达多步逆合成基准 SOTA,35% 分子成功求解 — DeryaTR_ · 2026-10-03
- 双卡跑 262K 上下文:三个补丁把 Strata 推理提速至 130 tok/s — Fz1zz · 2026-10-03
- Grok Bot 用量额度重置,网友庆祝周末畅玩 — mark_k · 2026-10-03