Qwen3.8-27B 登陆 Mac,M5 Max 跑出 933 tok/s

max_paperclips · x · 2026-08-15

Qwen3.8-27B 模型发布,MLX-VLM 和 NativAI 宣布提供首发支持。在 M5 Max 128GB 设备上的初步性能测试显示:Prefill 速度达 933 tok/s,Decode 速度为 33 tok/s。模型在 256k 上下文长度下仍能保持连贯性和合理的性能表现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →