开源项目让手机运行120B MoE模型,速度达6 tokens/s

dai_app · reddit · 2026-07-30

开发者 daiapp 创建了 bigedgeonmoe 开源项目,基于 llama.cpp 实现 MoE 模型在移动设备或消费级 PC 上运行。Qwen 35B (Q4) 在 12GB 内存的中端手机上可达 6 tokens/s。项目支持从 Qwen 35B 到开源 120B 模型,模块化设计,新模型只需一行代码注册。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →