开源三值化 LLM 引擎 Tritium:显存占用大降且推理速度超越 llama.cpp

Wide_Big_6969 · reddit · 2026-07-31

开发者开源了基于 Rust/CUDA 编写的三值化(1.58 bit)大模型引擎 Tritium(Apache 2.0)。该项目旨在以极小的精度损失大幅降低模型的显存(VRAM)占用、磁盘空间并提升推理速度。

核心性能数据:

技术亮点:

作者计划在后续的稳定版 v1.1 中,将 Qwen 3.6 27B 模型转换为三值化模型,且预期相对困惑度增加低于 1.0%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →