27B 模型被压进 iPhone
xiaohu · x · 2026-07-15
PrismML 基于 Qwen3.6-27B 做了模型压缩,把原本约 54GB 的 27B 模型压到约 3.9–5.9GB,目标是在手机上本地运行。
他们在“高强度思考模式”下用 15 项测试对比原版:
- Ternary 版(5.9GB,电脑端):保留约 95% 的原版能力
- 1-bit 版(3.9GB,手机版):也保留约 90% 的能力
性能上,作者称在 RTX 5090 上最高可达 163 token/s,在 Apple M5 Max 上可达 87 token/s。
所属事件:Bonsai 27B 发布:首个可在手机运行的 27B 模型(15 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11