三进制打包三值 GGUF:显存省 22% 且无损,9B 模型仅 2GB

pmttyji · reddit · 2026-09-05

开发者 llopresto87 为三值模型(如 BitNet-b1.58、Ternary-Bonsai)实现了一种更紧凑的 GGUF 格式 Q2B3 / B3S:利用权重只有 {-1, 0, +1}×块缩放的特性,直接用三进制(base-3)打包,128 个权重仅需 26 字节 trits + 1 个 f16 scale,即每权重 1.75 bit。

体积对比(仅权重):

要点:

作者目前最需要的帮助:NVIDIA / Apple 用户对比 CUDA/Metal 与 CPU 输出的一致性。仓库:llama-cpp-ternary-b3s 与 ternary-q20-repacker。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →