Qwen3.8-Next 跑上 M5 Air:3bit 量化达 150tps 预填充

maddie-lovelace · reddit · 2026-08-29

作者将几周前为 DeepSeek v4 开发的 MoE 流式推理栈适配到 Qwen3.8-Next,效果超出预期:在 M5 Air 低功耗模式下,使用 3bit 量化版本(Qwen3.8-Flash-Next-MLX-oQ3-MTP),2k token 提示词可达 150 tps 预填充、3.6 tps 解码。

作为对比,同机运行的 dense 27b 4bit 版本只有 70 tps 预填充、3 tps 解码——MoE 架构在端侧的吞吐优势明显(不过两者量化位数不同,并非严格对比)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →