Qwen 3.8 Flash Next 推理优化赛:MLX 与 CUDA 双双提速超 55%
gajesh · x · 2026-09-11
- 阿里 Qwen 在 Spark 和 MLX 两个社区同步上线 Qwen 3.8-Flash-Next 优化挑战,首次把两个社区的进展放在同一张图上对比。
- 挑战内容:让 Qwen 3.8 Flash Next 在两套具体配置上跑得更快——一侧是移植自 antirez ds4 引擎的 C/CUDA 方案(配合 Unsloth 的 GGUF 量化,跑在单台 NVIDIA DGX Spark 上),另一侧是 Swift/Metal 方案。
- 目前两个挑战方向均实现 55% 以上提速,CUDA 略微领先。作者称两个社区重叠度高,这是一场友好竞赛,旨在看同一模型在两边各能被推到什么程度。
所属事件:Qwen 3.8 Flash Next 推理优化赛开启,MLX 与 CUDA 双赛道提速超 55%(2 条相关)→
「Infra」频道最新
- 传 spcx 一周前再签超大算力协议,ARR 达 130 亿美元 — rwang07 · 2026-09-11
- PyTorch Lightning checkpointing 提速最高 95%,联合 Google Cloud 优化 — LightningAI · 2026-09-11
- LuxTTS 开源:1GB 显存跑 48kHz 声音克隆,速度达实时 150 倍 — tom_doerr · 2026-09-11
- 近 10% 暴露的 LiteLLM 网关仍接受默认管理密钥 sk-1234 — Thionne_WTZ · 2026-09-11
- K2 Horizon 用 LoRA 并行解码提速 3 倍,预训练吃下 20T tokens — rohanpaul_ai · 2026-09-11
- DOJ 盯上 Nvidia 吸纳 Groq:170 亿美元许可加挖角无并购申报 — Servola-Journal · 2026-09-11