1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3%
autonoma_2042 · reddit · 2026-09-19
作者在 8GB 的 NVIDIA T1000(Turing TU117)上实测 PrismML 的 Ternary-Bonsai-2-27B(三值 {−1,0,+1} 权重,约 1.75bpw,5.95GB,Qwen3.8-27B 稠密底座 + 3:1 Gated DeltaNet 混合注意力),替代原有的 Gemma 26B-A4B MoE(QAT Q4,专家常驻内存 + GPU 推理)跑有声书对白角色归属任务。
关键踩坑与结论:
- 需要 PrismML 的 llama.cpp fork(原版不识别 PTQ10);TU117 上 prefill 约 18 tok/s。
- 只要有一层掉到 CPU,速度从 6.5 tok/s 暴跌到 2.5 tok/s(2.6 倍惩罚):CPU 内核无 AVX 优化,且一层在 CPU 会让所有层的融合 DeltaNet 算子失效。
- 最终配置 -ngl all -b 2048 -ub 256 -ctk q80 -ctv q80 才能塞进 6.6GB 可用显存;每请求引文从 32 降到 16 以避免 8192 上下文溢出(每次溢出重试约 13 分钟)。
- 在 480 条人工校对金标上达到 93.3% 角色归属准确率,但存在叙述者身份漂移(长章节约一半错误源于此)与相邻对话互换问题。
整体结论:5.9GB 的三值稠密模型在单卡 8GB 场景可行性得到验证,但长上下文推理与身份一致性仍是短板;原文方法论与参数设置对本地部署玩家有直接参考价值。
「Infra」频道最新
- 开源 Observer v3:本地 LLM 盯屏幕的微 agent 监控框架 — Roy3838 · 2026-09-19
- 12GB 显存跑通 YuE2 BF16:实测音质更好,附优化参数 — lazyspock · 2026-09-19
- 硬核玩家魔改 ROCm 6.4.3 让 AMD MI50 恢复训练,还用 Vulkan 跑通 — Savantskie1 · 2026-09-19
- 开源引擎 Inco Splash 让 Qwen3.8-27B 在 M5 Max 跑出 144 tok/s — ResearchCrafty1804 · 2026-09-19
- macOS 27 竟内置 mlx_whisper,Agent 可自动转写视频文稿 — vista8 · 2026-09-19
- 英伟达支持的 Nscale 冲刺上市:合同额达 1034 亿美元 — IanAndrewsDC · 2026-09-19