纯 MLX 引擎推理提速至 65 tok/s,显存需求减半
EyalToledano · x · 2026-08-28
作者正在开发一个纯 MLX 推理引擎,以摆脱现有组件依赖并挖掘机器性能极限。目前成果包括:
- 速度:在零精度损失下达到 65 tok/s,目标 100+。
- 显存优化:通过 Expert paging 技术将模型占用从 39GB 降至 20GB。
实测数据展示,Qwen3.8-Flash-Next-REAP 的 8bit 和 4bit 变体在保持高 HumanEval 分数的同时,显著降低了内存占用。
「Infra」频道最新
- 传闻 Anthropic 拟自研训练芯片,深入算力基建 — zephyr_z9 · 2026-08-28
- 印度砸 134 亿美元推「半导体 2.0」,力攻芯片设计与制造 — SumitGup · 2026-08-28
- Meta/Google 将探讨 AI 数据中心光互连架构与能效 — jwt0625 · 2026-08-28
- Coherent-lite 在可插拔光模块能效追平 IMDD — jwt0625 · 2026-08-28
- Qwen3.8 变体实测:8 位量化显存占用降 27% — EyalToledano · 2026-08-28
- Qwen3.8 180B 级模型仅需 39GB 显存即可运行 — EyalToledano · 2026-08-28