从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps

HankYeomans · x · 2026-10-08

作者介绍 mlx-stream 对 mlx-serve 的扩展,配合 DeepSeek-V4.1-Flash 实现「预测性 SSD 流式加载」:模型的 MoE 专家权重从 SSD 按需流式读取。核心优化是把每层 MoE 的 router 提前到 attention 完成前先运行,使专家权重的磁盘读取更早启动;在 16K token 上下文时,填充每层所需的读取中有 81% 得以提前发起。最终在 Mac 上实现接近 40 tokens/秒的解码速度,展示了消费级硬件跑超大 MoE 模型的可行路径。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →