Qwen 27B模型经极端量化成功登陆手机端

Prism ML 近日展示了其 Bonsai 27B 项目,通过极端量化技术将基于 Qwen 的 27B 参数模型大幅压缩至 3.9GB。这使得该模型不仅能轻松在单张 RTX 3090 显卡上加载,甚至成功在 iPhone 17 Pro 上实现本地运行,速度达到约 11 tokens/s,展现了端侧运行大模型的巨大潜力。

2026-07-15 ~ 2026-07-17 · 2 条相关