M5 Max 跑 Qwen3.8-Flash-Next 百万上下文,MLX 引擎实测 40 tok/s

Beamsters · reddit · 2026-09-09

MLX-serve 引擎的共同作者为 Qwen3.8-Flash-Next 新增支持,在 M5 Max 128GB 上实现了 100 万 token 上下文的本地推理:

资源:引擎 mlx-serve、模型权重(HuggingFace)、Opencode2 插件均已开源。作者提醒仍可能有 bug,欢迎报告。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →