12GB 内存手机跑 92GB 模型,开源引擎突破端侧 MoE 部署极限
dai_app · reddit · 2026-08-05
开发者展示了名为 BigMoeOnEdge 的开源引擎,成功在中端 Android 手机(12GB RAM)上运行了高达 92GB 的 DeepSeek V4 Flash IQ2M 模型,速度达到 1 token/s。
- 技术突破:该引擎基于 llama.cpp 的模块化能力,证明了即便是参数量惊人的大型 MoE 模型,也能在资源受限的移动设备或消费级 PC 上实现响应。
- 兼容性:除了 DeepSeek,该引擎还支持运行 Gemma 26B、Qwen 3 等多种模型,甚至有用户在此框架下跑起了 397B 的大模型。
- 虽然目前 1 tok/s 的速度尚不具备日常实用价值,但完美验证了端侧超大模型部署的技术可行性,仅需一行代码即可部署。
「Infra」频道最新
- 马斯克:Starmind 卫星设计将用于地面数据中心 — elonmusk · 2026-08-05
- NVIDIA 与 SpaceX 合作:将 Vera Rubin 送入太空轨道 — nvidia · 2026-08-05
- 曝 SpaceX 携手 NVIDIA:计划发射百万颗算力卫星 — ns123abc · 2026-08-05
- 开源 AI 托管算力告急:DeepSeek Flash 因全球 GPU 短缺被迫下线 — bindureddy · 2026-08-05
- 16块GB10集群成功跑通Kimi K3,吞吐超20tps — ciprianveg · 2026-08-05
- Marvell 扩展 AI 内存基础设施,加速 Agentic AI 推理 — BenBajarin · 2026-08-05