Android 上跑超大 MoE

dai_app · reddit · 2026-07-19

作者做了一个在 **Android 手机上运行超出内存 5 倍以上的 MoE 模型** 的实验项目 **BigMoeOnEdge**。 ### 核心思路 - 利用 MoE 每个 token 只路由到少量专家的特性,不把整模型常驻内存。 - 通过路由 hook 观察每层选中的专家,再从闪存直接流式读出对应 tensor 切片,重新绑定指针后计算。 - 其余参数不进 RAM,只在需要时按 token 加载。 ### 实测结果 - 在普通 Android 手机上,**Qwen3.6-30B-A3B Q4_K_M**: - 直接 `mmap` 约 **0.1 tok/s**,会因页缓存抖动而很慢 - 专家流式方案可到 **3.8 tok/s**,CLI 下 **5 tok/s 以上** - **gpt-oss-120b** 也能在同一设备上加载并生成,速度约 **1–2 tok/s** ### 额外信息 - 项目基于 **llama.cpp**,通过公开 eval callback 和 gguf API 实现,升级 upstream 只需版本变更。 - 作者还做了正确性校验:流式输出与完全驻留版本必须逐字节一致。 - 代码与方法说明是 **Apache-2.0** 开源。

所属事件:安卓手机实验跑通 120B 级 MoE(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →