Qwen 3.6 35B MoE 在 12GB 内存的小米 12 Pro 上跑到 2.4 tok/s
Aromatic_Ad_7557 · reddit · 2026-07-24
一位 Reddit 用户展示了自己在一台改装过的 Xiaomi 12 Pro(12GB RAM) 上,成功运行 Qwen 3.6 35B MoE 的实测结果。
借助 BigMoeOnEdge,模型在 Q4KM 量化下达到了约 2.428 tok/s,TTFT 约 19.9 秒,上下文上限只有 8192 tokens,并且 CPU 占用和分页都很重。帖子还给出了详细的 token、compute、cache 与 I/O 统计,说明超大 MoE 模型确实能在手机级边缘设备上本地跑起来,但代价是明显的延迟与内存瓶颈。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11