1.58bit 三进制 27B 模型跑进 12GB 显卡,CUDA 补丁再提速 32%
airesearch12 · x · 2026-09-19
PrismML 发布的 Ternary Bonsai 2 27B(基于 Qwen 3 27B 的 1.58-bit 三进制压缩版,PTQ10 量化,仅 1.75 bits/权重)在消费级显卡上引发热议。
- 原始演示:一位用户在 RTX 3060 12GB 上用 5.9GB 文件让该模型一次性生成完整前端页面,生成了 41k token、思考了 46 分钟、上下文跑到 77k 仍未丢失线索;新权重 26 tok/s,77k 深度下 13 tok/s,完整 262k 上下文常驻。
- CUDA 手术补丁:GitHub 项目 bonsai-ada-surgery 对 PrismML 的 llama.cpp fork 做内核级优化,让三进制 GEMV 解码跑满 DRAM 带宽。在 RTX 4070 12GB 上实测提速 +2832%(TG128 从 50.9 tok/s 提升),不重新量化、数学位级一致,通过 153/153 后端测试与逐字节一致的贪婪生成验证。
- 该补丁非 4070 专属,在 2060 Super 上也有约 11% 提速。
所属事件:PrismML 三值量化 Bonsai 2 27B 发布并上线 OpenRouter(20 条相关)→
「Infra」频道最新
- 三行 bash 逃逸 Docker 沙箱:virtio-fs TOCTOU 漏洞获编 CVE-2026-77179 — blaizedsouza · 2026-09-19
- Meta 开源 spmd_types:为分布式训练设计的 SPMD 类型系统 — austinvhuang · 2026-09-19
- Cosmos DB 团队 VLDB 论文:更优调度策略年价值可达上亿美元 — blaizedsouza · 2026-09-19
- Qwen 3.8 27B 单卡 RTX 5090 本地跑通全代码动画制作 — Acceptable-Object390 · 2026-09-19
- Compiler Explorer 年编译 9200 万次,创始人详解背后架构 — blaizedsouza · 2026-09-19
- 爆料称 Meta 大量租用虚拟机跑 Muse,CPU 需求将暴涨 — zephyr_z9 · 2026-09-19