Qwen3.8-Next 跑上 M5 Air:3bit 量化达 150tps 预填充
maddie-lovelace · reddit · 2026-08-29
作者将几周前为 DeepSeek v4 开发的 MoE 流式推理栈适配到 Qwen3.8-Next,效果超出预期:在 M5 Air 低功耗模式下,使用 3bit 量化版本(Qwen3.8-Flash-Next-MLX-oQ3-MTP),2k token 提示词可达 150 tps 预填充、3.6 tps 解码。
作为对比,同机运行的 dense 27b 4bit 版本只有 70 tps 预填充、3 tps 解码——MoE 架构在端侧的吞吐优势明显(不过两者量化位数不同,并非严格对比)。
「Infra」频道最新
- 优化 AI 全链路延迟的四种实践方法 — bibryam · 2026-08-29
- 分析 3 万次 LLM 跑分:日间波动 2.8 分 — ionutvi · 2026-08-29
- 性能优化案例:延迟从 8ms 降至 0.87ms — DanielLockyer · 2026-08-29
- DGX Spark 实测:DeepSeek V4 Flash 跑通 90 万 token 长提示 — jtsaint333 · 2026-08-29
- AutoFAB 用机器人手臂接管 3D 打印机,实现 24/7 无人生产 — TinfoilTricorn · 2026-08-29
- 质疑 OpenAI 报告:模型是否预训练了受害者架构图? — Kremho · 2026-08-29