M5 Max 跑 Qwen3.8-Flash-Next 百万上下文,MLX 引擎实测 40 tok/s
Beamsters · reddit · 2026-09-09
MLX-serve 引擎的共同作者为 Qwen3.8-Flash-Next 新增支持,在 M5 Max 128GB 上实现了 100 万 token 上下文的本地推理:
- 使用 8bit KV cache,混合量化(dense 层 8bit、专家层 4bit),保持较高模型质量
- 实测生成速度:长上下文下散文约 40 tok/s、代码约 75 tok/s,可全程维持
- 跑满 1M 上下文需设置 iogpu.wiredlimitmb=120000,峰值内存约 117GB
- 作者强调这是真实 temp 1.0 采样下的深度上下文工作负载,而非短上下文跑分演示;还用模型生成了 MLX Serve Monitor 插件(Opencode2 内可见)
资源:引擎 mlx-serve、模型权重(HuggingFace)、Opencode2 插件均已开源。作者提醒仍可能有 bug,欢迎报告。
「Infra」频道最新
- Cerebras 论文:层 dropout 省四分之一训练算力,推理提速 1.55 倍 — burny_tech · 2026-09-09
- Viettel 三层开源栈统一 GPU 集群,打造 Token-as-a-Service 平台 — PyTorch · 2026-09-09
- 动作每回合都变?把工具 Schema 放最后一条消息保住缓存 — Low_Bad_6585 · 2026-09-09
- 开源项目 minnow:主打高速的 LLaDA2.2 推理服务器 — coder543 · 2026-09-09
- PyTorch 成立加速器适配工作组,破局 AI 算力硬件异构难题 — PyTorch · 2026-09-09
- HiSparse 混合稀疏注意力进 vLLM,8×H200 并发从 5 提到 25 — eliebakouch · 2026-09-09