开源项目让手机运行120B MoE模型,速度达6 tokens/s
dai_app · reddit · 2026-07-30
开发者 daiapp 创建了 bigedgeonmoe 开源项目,基于 llama.cpp 实现 MoE 模型在移动设备或消费级 PC 上运行。Qwen 35B (Q4) 在 12GB 内存的中端手机上可达 6 tokens/s。项目支持从 Qwen 35B 到开源 120B 模型,模块化设计,新模型只需一行代码注册。
「Infra」频道最新
- Together AI 开源模型生产部署线上说明会 — togethercompute · 2026-07-31
- AI数据中心噪音达105分贝,科技巨头遭多地居民集体诉讼 — mkheck · 2026-07-31
- Yahoo 利用 Amazon Bedrock 实现搜索重定向,关键词扩展率提升 600 倍 — AWS ML Blog · 2026-07-31
- 分析师称AI基本面未变:算力仍匮乏,全球渗透率极低 — BenBajarin · 2026-07-31
- AI 算力建设热潮验证了 KPCB 绿色科技基金 — matt_slotnick · 2026-07-31
- 中国 DUV 光刻机进展:目标非替代 ASML,而在打通迭代闭环 — demian_ai · 2026-07-31