Qwen 27B被压到iPhone上跑
pmttyji · reddit · 2026-07-13
PrismML 公开表示,自己把 阿里开源模型 Qwen 3.6-27B 压缩到能在 iPhone 17 Pro 上运行,并计划下周开放下载。
文中信息包括:
- 原始模型有 270 亿参数,压缩后体积降到 4GB 以下,从约 54GB 缩小到可上手机。
- PrismML 称该模型仍能做复杂聊天、推理、自治 agent 和软件编码。
- 公司 CEO 认为,未来大部分 AI 计算会转向本地设备,云端只处理最后一小部分高端需求;他强调这会“根本改变 AI 的经济学”。
- 这项技术来自 Caltech 的数学研究,学校持有相关专利并独家授权给 PrismML。
- 文章还对比了苹果的新一代端侧模型:苹果的一些模型虽然参数更多,但使用稀疏架构,激活参数远少于 PrismML 这个“全量激活”的方案。
整体上,这是一个典型的 端侧大模型压缩/本地推理 新闻,同时也带有模型能力和部署经济学含义。
所属事件:Bonsai 27B 发布:首个可在手机运行的 27B 模型(15 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11