Qwen3.8 预览版登顶英伟达 CUDA 算子优化榜
智东西 · wechat · 2026-07-22
Qwen3.8 预览版登顶英伟达算子优化榜
阿里千问的 Qwen3.8 preview 被报道在英伟达 SOL-ExecBench 的 FlashInfer-Bench 子集上拿下第一,超过腾讯混元、人类开发者和 Cursor。这个榜单专门评测模型/智能体对 CUDA kernel 的优化能力,目标硬件是 Blackwell B200,评分看的是内核表现距离硬件理论极限有多近,而不只是比软件基线快多少。
- 榜单规模:共 235 个 CUDA 优化任务,来自 124 个模型,覆盖大语言模型、扩散、视觉、音频、视频和混合负载。
- 评分含义:SOL 分数越高,说明 kernel 越接近峰值算力与带宽共同决定的理论上限。
- 为什么重要:英伟达把这类任务视为少数能提供清晰客观反馈的真实工程问题,适合训练能从硬件执行结果中持续自我改进的模型。
- Qwen3.8 细节:它拿下的是面向推理系统 kernel 的 FlashInfer-Bench 子集,覆盖 fused attention、FP8 MoE、RMSNorm 等关键算子;文中还提到评测时经历了数万轮工具调用迭代。
文章认为,这类成绩不只是“跑分”,也意味着模型在系统级优化、编译器式推理和闭环自我改进方面出现了更强能力。
所属事件:阿里 Qwen3.8-Max 预览版登顶英伟达推理优化榜(3 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11