纯 MLX 引擎推理提速至 65 tok/s,显存需求减半

EyalToledano · x · 2026-08-28

作者正在开发一个纯 MLX 推理引擎,以摆脱现有组件依赖并挖掘机器性能极限。目前成果包括:

实测数据展示,Qwen3.8-Flash-Next-REAP 的 8bit 和 4bit 变体在保持高 HumanEval 分数的同时,显著降低了内存占用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →