M4 Max 跑 Qwen3.8-27B:长上下文下 oMLX 胜出,前缀缓存最提速
vitordeas · reddit · 2026-08-30
在 M4 Max (128GB) 上测试了 5 种运行时/量化栈运行 Qwen3.8-27B 在 32K-256K 上下文的速度。
核心结论:
- 短/中上下文 (≤128K):集成推测解码的 MTPLX 4-bit 最快。
- 长上下文 (256K):MTPLX 验证步骤崩溃 (7 tok/s),无推测的 oMLX 和 mlx-dspark 优势明显 (14-15 tok/s)。
- 最大提速来自前缀缓存:热缓存将 256K 的冷预填从 40 分钟降至 2 分钟。oMLX 支持中间编辑缓存,MTPLX 不支持。
技术细节:测试涵盖 oMLX (AWQ/oQ8e)、MTPLX (原生 MTP)、mlx-dspark (DFlash2 起草器)。
「Infra」频道最新
- 不仅要掌控模型调用,更要掌控模型层本身 — omarsar0 · 2026-08-30
- GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化 — CentrifugalMalaise · 2026-08-30
- 腾讯混元 Hy4-preview 亮相 vLLM:770B MoE 配 1M 上下文 — TencentHunyuan · 2026-08-30
- 「分片就是传输」:青稞 AI 突破 2M 上下文显存瓶颈 — 青稞AI · 2026-08-30
- 开源后端 Oberik:解决 Agent 文档解析与多租户痛点 — kahveciderin · 2026-08-29
- CUDA 开发者详解“粘性错误”与设备端未定义行为 — blelbach · 2026-08-29