Prism ML 把 Qwen 27B 从 60GB 压到 6GB,1.5-bit 量化后可跑树莓派
rohanpaul_ai · x · 2026-10-08
Emad Mostaque 在 Tom Bilyeu 播客中展示极端量化进展:Alibaba Qwen 27B 常规需要约 60GB 内存,Prism ML 团队用 1.5-bit(而非 16-bit)存储数值,将其压到 6GB,同时保留约 95% 的性能。
- 6GB 的体量足以在树莓派上运行,而树莓派功耗与人类大脑相当。Mostaque 据此称 AI 模型「已基本达到人脑的效率」。
- 完整视频在 Tom Bilyeu YouTube 频道。
所属事件:1.5-bit 量化让 Qwen 27B 可跑树莓派(3 条相关)→
「Infra」频道最新
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- DWDM 波长锁定精度收紧至 ±3.5GHz,OFC 后光互连规格再进化 — jwt0625 · 2026-10-08
- llama.cpp 新 PR 覆盖全部 26 种权重格式,Mac GPU 矩阵乘最高快 4.4 倍 — ggerganov · 2026-10-08
- Theo 算账:所谓 1.32 亿美元年 API 成本被夸大 44 倍,一年后或仅千美元 — dotey · 2026-10-08
- SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍 — sehoonkim418 · 2026-10-08
- 线性注意力占大 batch 解码延迟 75%,读状态成瓶颈 — sehoonkim418 · 2026-10-08