KernelBench 最新排名:Claude Opus 5 领跑,多模型表现各异
scaling01 · x · 2026-08-16
KernelBench 基准测试结果公布,涵盖 KernelBenchMega 和 KernelBenchHard 等多个任务。Claude Opus 5 在多个任务中表现最佳,但部分模型如 Qwen 3.8 Max 在某些任务中失败。具体排名和表现详见链接。
所属事件:Claude Opus 5 领跑 KernelBench 基准测试(2 条相关)→
「模型」频道最新
- 测试称 Flash-0731 存在过拟合,DS 免费版获赞 — teortaxesTex · 2026-08-16
- 传 Kimi K3 达 2.8T 参数,27B 密集模型其实不算小 — Xianbao_QIAN · 2026-08-16
- 3970亿参数AI在iPhone上运行:视频解析MoE设计与局限 — DJTRENDSETTA · 2026-08-16
- Grok 4.6 获 RuntimeWire 评测第一,击败 GPT-5.6 与 Claude — elonmusk · 2026-08-16
- SimpleBench 结果:Kimi-K3 表现诡异,Grok 4.6 领跑 — scaling01 · 2026-08-16
- DeepSeek 回应适配争议:模型首要为自己服务 — teortaxesTex · 2026-08-16