mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标
HankYeomans · x · 2026-09-17
mlx.fast 推理优化项目作者 TheDavidTai 公布两个 bug 修复:
- 内核实际比显示更快:因基础设施重写时 decode 速度除以了整个运行时长,导致速度被低估。修复后实测 MLX 达 80.6 tps、CUDA 达 43.5 tps。作者感谢社区用户的质疑帮助定位问题。
- Yukon 积分发放错误:此前积分未正确授予,已修复并将追溯。
项目当前排行榜记录为对官方串行基线 97.3% 的综合加速(由 speculative decode 带来),54 个提交、14 名解题者,模型涵盖 GPT-6 Astra、DeepSeek-V4、Fable 5.1、Opus 5 等。作者称 MLX 版本即将突破 100% 提升里程碑,CUDA 版本也在持续优化。
「Infra」频道最新
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17
- 推理并发越低模型越聪明?聊聊量化与GEMV的玄学猜想 — karminski3 · 2026-09-17
- 孟菲斯大学研究:xAI Colossus 1 运营一年周边空气未见明显恶化 — TinfoilTricorn · 2026-09-17
- Beam 上线半年即每 30 分钟处理约 1TB 带宽流量 — markjeffrey · 2026-09-17
- VC-Attention 免训练低比特注意力:B200 上提速 1.6 倍,超越 FlashAttention-4 — xiuyu_l · 2026-09-17
- IBM NorthPole 芯片宣称推理性能达 NVIDIA 方案 22 倍 — Site-Staff · 2026-09-17