Qwen3.8 预览版登顶英伟达 CUDA 算子优化榜
智东西 · wechat · 2026-07-22
Qwen3.8 预览版登顶英伟达算子优化榜
阿里千问的 Qwen3.8 preview 被报道在英伟达 SOL-ExecBench 的 FlashInfer-Bench 子集上拿下第一,超过腾讯混元、人类开发者和 Cursor。这个榜单专门评测模型/智能体对 CUDA kernel 的优化能力,目标硬件是 Blackwell B200,评分看的是内核表现距离硬件理论极限有多近,而不只是比软件基线快多少。
- 榜单规模:共 235 个 CUDA 优化任务,来自 124 个模型,覆盖大语言模型、扩散、视觉、音频、视频和混合负载。
- 评分含义:SOL 分数越高,说明 kernel 越接近峰值算力与带宽共同决定的理论上限。
- 为什么重要:英伟达把这类任务视为少数能提供清晰客观反馈的真实工程问题,适合训练能从硬件执行结果中持续自我改进的模型。
- Qwen3.8 细节:它拿下的是面向推理系统 kernel 的 FlashInfer-Bench 子集,覆盖 fused attention、FP8 MoE、RMSNorm 等关键算子;文中还提到评测时经历了数万轮工具调用迭代。
文章认为,这类成绩不只是“跑分”,也意味着模型在系统级优化、编译器式推理和闭环自我改进方面出现了更强能力。
所属事件:阿里 Qwen3.8-Max 预览版登顶英伟达推理优化榜(3 条相关)→
「Infra」频道最新
- 一篇看懂 AI 芯片背后的软件和代工链 — shashib · 2026-07-22
- AI 智能体会用加密钱包,还是只要更好的支付 API — Digitalpaver · 2026-07-22
- GLM 上线后又开始试 8×H100 跑 DSv4 Flash — TheZachMueller · 2026-07-22
- llama.cpp 在 b10087 版本新增 Laguna XS.2 和 M.1 支持 — LaurentPayot · 2026-07-22
- LightOn Search 在 BrowseComp-Plus 夺得第 5 名,准确率 86.27% — CShorten30 · 2026-07-22
- Nvidia Spectrum 交换机加入 CPO 支持,Lambda 已在测试 — TheZachMueller · 2026-07-22