Bonsai 27B 发布:首个可在手机运行的 27B 模型

7 月 15 日,PrismML 正式发布 Bonsai 27B,并宣称这是首个能在手机上运行的 27B 级模型。它以阿里 Qwen3.6 27B 为基础,通过极低比特量化把原本约 54GB 的权重压缩到数 GB 量级,把过去只能停留在云端或高端工作站的 27B 能力推进到手机、浏览器和中低显存设备,因此迅速在本地推理圈引发关注。

关键细节

@thoquz 指出,PrismML 同时放出了 Hugging Face 权重和 GGUF 版本,便于本地加载;@xenovatech 转述称该模型采用 1-bit dense LLM 架构,并搭配自定义 WebGPU kernels,可直接在浏览器本地运行。落地平台方面,@awnihannun(转发)列出 iPhone 17 Pro、iPhone Air 及部分 iPad;@tcarambat 与 @immersive-matthew 则分别强调,它把 27B 级模型压进约 10GB 内存或 12GB 显存的可运行范围。

性能与说法

关于压缩后体积,不同帖子给出 3.8GB 到 3.9–5.9GB 不等的数字。@xiaohu 与 @airesearch12 转述 PrismML 的测试称,在 15 项对比中,Ternary(1.58 比特)版约保留 95% 能力,1-bit 版约保留 90%。@pbaylies(转发)补充了 Ternary-Bonsai-27B 在单张 3090 上、llama-bench 在 32k/64k/128k 上下文下的吞吐实测(其中 32k 约 956)。多条转发还提到它支持多步推理、结构化工具调用和长上下文工作流;@victormustar(转发)另称评测借助了 Fable 5 与 GPT 5.6 Sol。

时间线与影响

@pmttyji 在 7 月 13 日的帖中称,PrismML 已把 Qwen 3.6-27B 压到可在 iPhone 17 Pro 运行,并预告下周开放下载;到 7 月 15 日,多条帖子显示 Bonsai 27B 正式上线。若体积与能力保留数据成立,Bonsai 27B 代表的是一条激进的本地化路线:用极低比特压缩,把 27B 级模型带进手机与浏览器场景。

2026-07-13 ~ 2026-07-15 · 15 条相关

一手来源

另有 2 条近重复转述:dair_ai · zacharynado