从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps
HankYeomans · x · 2026-10-08
作者介绍 mlx-stream 对 mlx-serve 的扩展,配合 DeepSeek-V4.1-Flash 实现「预测性 SSD 流式加载」:模型的 MoE 专家权重从 SSD 按需流式读取。核心优化是把每层 MoE 的 router 提前到 attention 完成前先运行,使专家权重的磁盘读取更早启动;在 16K token 上下文时,填充每层所需的读取中有 81% 得以提前发起。最终在 Mac 上实现接近 40 tokens/秒的解码速度,展示了消费级硬件跑超大 MoE 模型的可行路径。
「Infra」频道最新
- Windows 现场 demo:编码任务被自动路由到本地模型,llama.cpp 已接入 Windows ML — ryanshrout · 2026-10-08
- exe.dev 详解超线程侧信道风险:用 core scheduling cookie 做团队级隔离 — davidcrawshaw · 2026-10-08
- NVIDIA 发布 LoGRA:强化学习训练显存最高省 45.7% — mark_k · 2026-10-08
- 6 卡 3090 无 NVLink 跑 Qwen3.8-Flash-Next:prefill 快 8-10 倍,长文解码快 2-3 倍 — flynth92 · 2026-10-08
- DeepMind Philipp Schmid:每个 Agent 都该有自己的云端沙盒 — AI Engineer · 2026-10-08
- GitHub 全球宕机,工程师吐槽「正在抢修」 — iannuttall · 2026-10-08