27B 模型被压进 iPhone

xiaohu · x · 2026-07-15

PrismML 基于 Qwen3.6-27B 做了模型压缩,把原本约 54GB 的 27B 模型压到约 3.9–5.9GB,目标是在手机上本地运行。

他们在“高强度思考模式”下用 15 项测试对比原版:

性能上,作者称在 RTX 5090 上最高可达 163 token/s,在 Apple M5 Max 上可达 87 token/s。

所属事件:Bonsai 27B 发布:首个可在手机运行的 27B 模型(15 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →