Qwen 3.6 35B MoE 在 12GB 内存的小米 12 Pro 上跑到 2.4 tok/s

Aromatic_Ad_7557 · reddit · 2026-07-24

一位 Reddit 用户展示了自己在一台改装过的 Xiaomi 12 Pro(12GB RAM) 上,成功运行 Qwen 3.6 35B MoE 的实测结果。

借助 BigMoeOnEdge,模型在 Q4KM 量化下达到了约 2.428 tok/s,TTFT 约 19.9 秒,上下文上限只有 8192 tokens,并且 CPU 占用和分页都很重。帖子还给出了详细的 token、compute、cache 与 I/O 统计,说明超大 MoE 模型确实能在手机级边缘设备上本地跑起来,但代价是明显的延迟与内存瓶颈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →