KernelBench MEGA 榜单:Grok 4.7 xhigh 五大内核题全绿
scaling01 · x · 2026-09-22
elliotarledge 在 kernelbench.com 的 KernelBenchMega 上用 RTX PRO 6000 跑了 Grok 4.7 [xhigh]:无限预算下每个会话都在 100 分钟内自行结束,所有内核正确,且所有分数都经过 l trace 级和提交级 reward-hack 审计后的独立重评。
榜单共有五道内核题:Kimi-Linear Decode megakernel、Grid + MinGRU(近似模拟)、Native Sparse Attention、GLM-5.3 的 Fused MoE、MegaQwen Decode。页面显示各家前沿模型在 H100/RTX PRO 6000/B200 等硬件上的通过情况,多数模型在多数题目上得 0 分,部分出现 flag/pass/build 等状态。
「编程与Agent」频道最新
- 开源 jevmail:3 美分本地分拣 1000 封 Gmail,只读保护隐私 — _AustinCalvert_ · 2026-09-22
- 数据中心金融 Agent Kos 获 8VC 领投 1200 万美元融资 — ahelkky · 2026-09-22
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22
- LangSmith 集成 Jev:低成本大规模 trace 挖掘,直接产出 eval — hwchase17 · 2026-09-22
- Shopify 全面接入 Muse 代理结账,CEO 暗讽 Amazon 护广告业务 — firstadopter · 2026-09-22
- 如何在本地、预发、评审间切换编码 Agent 的访问配置? — radim11 · 2026-09-22