KernelBench 新增 CUDA 子基准,并在三种 GPU 上重跑 Fable
TheZachMueller · x · 2026-07-22
KernelBench 新增了一个 KernelBench-CUDA 子基准,包含 4 个问题:GLM 5.2 MoE、DeepSeek NSA、minGRU 的 sequence-parallel scan,以及原来的 MegaQwen decode 任务。
- 这个子基准刻意去掉 Triton 和其他 DSL,要求模型只能写 CUDA。
- 作者说明,之前的 Fable 运行因为使用时长限制而被截断,这次改成了无限时长,并在 RTX PRO 6000、H100、B200 上重新跑。
- 配图给出了 Fable 5、Opus 4.8、Grok 4.5、Kinetic 在各任务上的对比。
- 线程里提到的最大意外是:Fable 的 NSA kernel 在最难题上据称领先全场 1.7 倍。
「编程与Agent」频道最新
- 内部智能体工作流把看板任务直接变成审查过的 PR — alex_verem · 2026-07-22
- AI Agent 工具应面向非技术用户:他们只想要答案,不要日志 — Previous_Net_1154 · 2026-07-22
- Chip Huyen 的 AI Engineering 仓库整理了 10 章免费笔记 — techNmak · 2026-07-22
- Reddit 讨论 8–12GB 本地模型做编码的工具栈 — salgado18 · 2026-07-22
- Karpathy 提出后,四支团队独立做出 LLM Wiki 模式 — garrytan · 2026-07-22
- Greptile 用 GPT 审 Claude 代码、用 Claude 审 GPT 代码 — garrytan · 2026-07-22