Qwen 3.8 Flash Next 推理优化赛开启,MLX 与 CUDA 双赛道提速超 55%

阿里 Qwen 在 Spark 与 MLX 社区同步上线 Qwen 3.8-Flash-Next,并发起首个本地推理优化挑战,首次将两个社区的进展放在同一张图上对比。挑战围绕同一模型在 MLX 与 CUDA 两条技术栈上比拼推理速度,目前双赛道均实现超 55% 的提速,其中 CUDA 赛道基于相关社区方案展开。

2026-09-11 ~ 2026-09-11 · 2 条相关