端侧实测:Nanbeige4.2-3B 的 KV Cache 效率远低于 Qwen MoE

TechTefa · reddit · 2026-07-28

开发者在 4GB 显存设备上实测了 Nanbeige4.2-3B 的量化版本。结果显示,其 KV Cache 效率表现不佳,在 f16 精度下仅能支持 6k 上下文,q80 精度下为 12k。

作为对比,他指出 Qwen 3.6 MoE 在相近条件下仅需 1.2GB 显存即可运行 64k 的 f16 上下文。因此,对于低配设备,作者认为继续使用 Qwen 系列的紧凑型模型是更优选择。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →