KernelBench leaderboard: Claude Opus 5 leads, but some models fail
scaling01 · x · 2026-08-16
KernelBench results show Claude Opus 5 leading in many tasks, while some models like Qwen 3.8 Max fail in certain tasks. Full details in link.
Related event: Claude Opus 5 Tops KernelBench Leaderboard(2 posts)→
More from Models
- Test finds Flash-0731 overfitting; DS free web app praised for speed — teortaxesTex · 2026-08-16
- Leaked specs put Kimi K3 at 2.8T params — and why a 27B dense model isn't small — Xianbao_QIAN · 2026-08-16
- 397-Billion-Parameter AI Runs on iPhone: Video Explains MoE Design and Limitations — DJTRENDSETTA · 2026-08-16
- Grok 4.6 Tops RuntimeWire Benchmark, Beating GPT-5.6 and Claude — elonmusk · 2026-08-16
- SimpleBench Results: Odd Performance from Kimi-K3, Strong Show by Grok 4.6 — scaling01 · 2026-08-16
- DeepSeek on Usability: Our Models Are Built Primarily for Ourselves — teortaxesTex · 2026-08-16