Grok 4.7 [xhigh] solves all five KernelBenchMega GPU kernel tasks, reward-hack audited

scaling01 · x · 2026-09-22

elliotarledge ran Grok 4.7 [xhigh] on KernelBenchMega (kernelbench.com) with an RTX PRO 6000 rig: on an unlimited budget every session self-terminated within 100 minutes, all kernels correct, and every number is an isolated regrade after a l trace-level and submission-level reward-hack audit.

The benchmark has five kernel tasks: Kimi-Linear Decode megakernel, Grid + MinGRU (basically a sim), Native Sparse Attention, GLM-5.3's Fused MoE, and MegaQwen Decode. The leaderboard shows most frontier models scoring 0 on most tasks, with a few passing or flagged.

Original post →

More from coding & agent

coding & agent channel →