安卓端流式跑120B MoE
dai_app · reddit · 2026-07-18
作者在一台 OnePlus 15R 安卓手机上,用约 11GB 可用内存、纯 CPU 和闪存,运行了包括 GPT-OSS-120B、Qwen 30B、Gemma 26B 在内的多个大模型,速度大约在 1–5 tok/s。
核心思路
- 利用 MoE 结构:每个 token 只激活少数专家,不必把全部 60GB 权重常驻内存
- 通过 ODIRECT 从闪存按需读取专家权重,配合小缓存和异步读取
- 结果与“完整加载到 RAM”的推理逐 token 一致,CI 里也有一致性测试
工程细节
- 底层不是 fork llama.cpp,而是通过公开 callback 和 gguf API 接入
- 新 MoE 模型只需在 registry 里加一行
- qwen3moe、qwen2moe、gemma4、gpt-oss 都已可用
实测表现
- GPT-OSS-120B:约 1.3 tok/s
- Qwen3-30B:约 5.2 tok/s
- Gemma-4-26B:约 4.1 tok/s
难点
真正麻烦的不是流式读取,而是 Android 在内存压力下会回收驻留权重,导致生成过程中不断重新分页;作者认为这部分几乎占了主要工作量。项目采用 Apache-2.0,已经提供预编译 APK。
所属事件:安卓手机实验跑通 120B 级 MoE(2 条相关)→
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11