mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3%
TheMoonMidas · x · 2026-09-11
-mlx.fast 推理优化挑战赛出现新纪录:求解者 davidtai 借助投机解码把 Qwen 3.8 125B-A6B 在 Mac 上的速度提升 15.3%(相对官方串行基线)。
- 官方评分为单流复合分:prefill 增益取 0.25 次幂、decode 增益取 0.75 次幂,decode 权重占四分之三;当前纪录 decode 达 36.3 TPS、prefill 1585.8 TPS,每轮约 1.4 token,使用 stock head(无额外训练)。
- 榜单由 benchd 计算并封存成绩,CUDA 侧尚无人上榜,欢迎挑战。
「Infra」频道最新
- NVIDIA 携手 Palantir,在 AIPCon 11 上展示供应链本体合作 — eliano · 2026-09-11
- KV Cache 也做 QAT?技术拆解解释某模型 fp4 精度下表现更好 — stochasticchasm · 2026-09-11
- 网友猜测 Anthropic 走谷歌加部分 AWS,OpenAI 绑定微软 Azure — ericwdolan · 2026-09-11
- 技术账号拆解某模型 engram 细节:素数表长、4-gram、fp8 — stochasticchasm · 2026-09-11
- 英伟达:Vera Rubin 每 MW 吞吐为 Blackwell Ultra 的 50 倍,token 成本降 35 倍 — Beth_Kindig · 2026-09-11
- Epoch AI:GPT 长上下文延迟呈二次增长,定价跳档源于架构差异 — Jsevillamol · 2026-09-11