Android 上跑超大 MoE
dai_app · reddit · 2026-07-19
作者做了一个在 **Android 手机上运行超出内存 5 倍以上的 MoE 模型** 的实验项目 **BigMoeOnEdge**。 ### 核心思路 - 利用 MoE 每个 token 只路由到少量专家的特性,不把整模型常驻内存。 - 通过路由 hook 观察每层选中的专家,再从闪存直接流式读出对应 tensor 切片,重新绑定指针后计算。 - 其余参数不进 RAM,只在需要时按 token 加载。 ### 实测结果 - 在普通 Android 手机上,**Qwen3.6-30B-A3B Q4_K_M**: - 直接 `mmap` 约 **0.1 tok/s**,会因页缓存抖动而很慢 - 专家流式方案可到 **3.8 tok/s**,CLI 下 **5 tok/s 以上** - **gpt-oss-120b** 也能在同一设备上加载并生成,速度约 **1–2 tok/s** ### 额外信息 - 项目基于 **llama.cpp**,通过公开 eval callback 和 gguf API 实现,升级 upstream 只需版本变更。 - 作者还做了正确性校验:流式输出与完全驻留版本必须逐字节一致。 - 代码与方法说明是 **Apache-2.0** 开源。
所属事件:安卓手机实验跑通 120B 级 MoE(2 条相关)→
「Infra」频道最新
- 共享 SLURM GPU 集群,可能成为研究者更便宜的算力入口 — Sauers_ · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21
- 现货内存价飙升 140%,合约重定价开始滞后 — tengyanAI · 2026-07-21
- 有人把 AI 使用方式指向异步长周期实验而非单买算力 — voooooogel · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- 有人主张给模型独立 micro VM,少用 tool calling — joecole · 2026-07-21