实测 Qwen N-gram 层升 Q8:精度提高速度几乎不掉
Altruistic_Heat_9531 · reddit · 2026-09-03
一位本地部署玩家实测把 Qwen 3.8 Next 中的 51B N-gram 层从低精度换成更高精度是否可行。受另一帖启发(有人在 5090 上换成 BF16 N-gram),作者在 IQ4XS 量化模型上换成 Q8 N-gram 并做了前后对比测试。
测试环境与结果:
- 硬件:96GB DDR4 三通道、Xeon E5-2690v4、RTX 3090(限制 250W),未启用 MTP
- 换 Q8 后短程生成速度从约 8.8 tok/s 提到约 10.7 tok/s,看似更快
- 但两者稳态最终都收敛在约 10.1 tok/s 左右
结论:把 N-gram 层升级到 Q8 几乎没有推理速度损失,输出质量是否提升仍在测试中。
「Infra」频道最新
- Andy Masley:数据中心反弹无助于 AI 安全,反而可能帮倒忙 — AndyMasley · 2026-09-03
- 断言:没有数据中心建设潮,美国早已陷入严重衰退 — ZeeshanZiaML · 2026-09-03
- Together AI 联手 Equinix 与 NVIDIA 打造全球分布式推理网络 — zhyncs42 · 2026-09-03
- 算力论战:游戏多人服早已证明人人都在租云端机器 — kuza55 · 2026-09-03
- Moondream 开源推理引擎 Photon 2.1:新增语音识别,吞吐最高 3.1 倍于 vLLM — xeophon · 2026-09-03
- llama.cpp 支持 M5 神经加速器,Mac 上 MLX 已无必要? — MrPecunius · 2026-09-03