Qwen 3.6 35B MoE 在 12GB 内存的小米 12 Pro 上跑到 2.4 tok/s
Aromatic_Ad_7557 · reddit · 2026-07-24
一位 Reddit 用户展示了自己在一台改装过的 Xiaomi 12 Pro(12GB RAM) 上,成功运行 Qwen 3.6 35B MoE 的实测结果。
借助 BigMoeOnEdge,模型在 Q4KM 量化下达到了约 2.428 tok/s,TTFT 约 19.9 秒,上下文上限只有 8192 tokens,并且 CPU 占用和分页都很重。帖子还给出了详细的 token、compute、cache 与 I/O 统计,说明超大 MoE 模型确实能在手机级边缘设备上本地跑起来,但代价是明显的延迟与内存瓶颈。
「Infra」频道最新
- Pydantic AI 展示 agent 一票分出 40 组测试,笔记本风扇先炸了 — AAAzzam · 2026-07-24
- Fluidstack 完成 8.3 亿美元 A 轮,估值达 75 亿美元 — MxMnr · 2026-07-24
- Google 今年 capex 指引已超过其 2021 年前全部累计开支 — ivan_bezdomny · 2026-07-24
- 英特尔称先进封装已起 backlog,业务可见度达数十亿美元 — BenBajarin · 2026-07-24
- 英特尔 Q2 数据中心销售额增长 59%,需求已超供给 — Polymarket · 2026-07-24
- AI 推荐可能先把用户推向奢侈品,再看到便宜替代 — PierceLilholt · 2026-07-24