1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3%

autonoma_2042 · reddit · 2026-09-19

作者在 8GB 的 NVIDIA T1000(Turing TU117)上实测 PrismML 的 Ternary-Bonsai-2-27B(三值 {−1,0,+1} 权重,约 1.75bpw,5.95GB,Qwen3.8-27B 稠密底座 + 3:1 Gated DeltaNet 混合注意力),替代原有的 Gemma 26B-A4B MoE(QAT Q4,专家常驻内存 + GPU 推理)跑有声书对白角色归属任务。

关键踩坑与结论:

整体结论:5.9GB 的三值稠密模型在单卡 8GB 场景可行性得到验证,但长上下文推理与身份一致性仍是短板;原文方法论与参数设置对本地部署玩家有直接参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →