GPU 内核基准的裁判有多弱?变异分析揭示 16.9% 缺陷漏检
NationalUniversityofSingapore · hf · 2026-09-22
LLM 生成 GPU 内核的基准通常只用少量随机输入加宽松浮点容差判定正确性,而这些裁决直接喂给排行榜和 RL 奖励。本文引入变异分析作为内核基准 oracle 的充分性度量:向 188 个 KernelBench 问题的已验证 CUDA 实现注入 10,303 个可编译故障(其中 7,384 个有独立 kill witness),任何测试协议按其检出的故障比例打分。
主要发现:
- 官方检查确定性地漏掉 1/6(16.9%)有 witness 的故障;算术类仅 8.7% 逃逸,但精度类高达 78.6% 漏检
- 机理可解释:容差盲区随归约规模增长;输入攻击性存在由合法浮点方差设定的上限
- 审计最强补丁:KernelBench-Verified 的提升可拆成隐藏输入 +4.0、收紧容差 +4.5(原作者无法计算该拆分);还曝光一个已发表的 fuzzing 配方会错误拒绝正确内核 107 次
- 基于 kill 矩阵优化测试套件,每题仅 2 个输入即达 98.0% 检出率(held-out 94.8%)
- 48 个整体架构上盲区随规模增长,集中于深层同质流水线;2 个问题被证明「无法裁判」——官方参考实现自身违反基准容差
全部以 KernelBench-M 数据集发布。
「研究」频道最新
- Mira-Scene 开源:单图 3D 场景重建在几何细节上超 GPT6 Astra — camenduru · 2026-09-22
- 实测 LLM 引用质量问题:八条引用从未全对,多源观点只标一条 — pizzababa21 · 2026-09-22
- GPT-6 Astra 免微调当机器人策略:成功率 22.48% 碾压全部公开方案 — ben_j_todd · 2026-09-22
- OpenAI 会吃掉 Jev 的午餐吗?单 token 分类器或是关键 — JnBrymn · 2026-09-22
- 研究者观点:实验室最有条件用 LLM 做自动化科研 — menhguin · 2026-09-22
- TRL 异步 GRPO 支持 LoRA,训练 500 步耗时从 3.5 小时降至 53 分钟 — SergioPaniego · 2026-09-22