开源三值化 LLM 引擎 Tritium:显存占用大降且推理速度超越 llama.cpp
Wide_Big_6969 · reddit · 2026-07-31
开发者开源了基于 Rust/CUDA 编写的三值化(1.58 bit)大模型引擎 Tritium(Apache 2.0)。该项目旨在以极小的精度损失大幅降低模型的显存(VRAM)占用、磁盘空间并提升推理速度。
核心性能数据:
- 以 BitNet 2B4T 模型为例,其体积仅占 1.71 GiB,比 fp16 小 7.5 倍。
- 在单张 RTX 4090 上,解码速度可达 280-300 tok/s,预填充速度达 12.3K tok/s。
- 在带宽归一化基准测试中,有效带宽(474 GiB/s)优于 llama.cpp(352 GiB/s)。
技术亮点:
- SALT 量化算法:提出了一种灵敏度分配的分层三值化方法,即使 QAT 失败也能通过添加三值化权重将误差降至接近 FP16 水平。
- SALT 感知训练:在训练循环中直接使用引擎进行量化,确保训练和部署时的权重表现完全一致。
作者计划在后续的稳定版 v1.1 中,将 Qwen 3.6 27B 模型转换为三值化模型,且预期相对困惑度增加低于 1.0%。
「Infra」频道最新
- 探秘投机解码的“有损验证”:机制、权衡与失败模式 — Tianyu Wang · 2026-07-31
- 单次AI提问与智能体工作流能耗相差十万倍 — AndyMasley · 2026-07-31
- UBS 图表揭示 AI 算力供应链的核心枢纽格局 — BenBajarin · 2026-07-31
- 凑齐512GB显存:开发者组装双机8卡V100推理集群 — UltraFOV · 2026-07-31
- 开源 Rust 推理引擎 runNburn:内存受限下跑 295B 模型,短上下文解码比 llama.cpp 快 2.8 倍 — coderyeon · 2026-07-31
- 亚马逊称 AI 需求远未触顶,2026 年资本支出将超 2200 亿美元 — inductionheads · 2026-07-31