端侧实测:Nanbeige4.2-3B 的 KV Cache 效率远低于 Qwen MoE
TechTefa · reddit · 2026-07-28
开发者在 4GB 显存设备上实测了 Nanbeige4.2-3B 的量化版本。结果显示,其 KV Cache 效率表现不佳,在 f16 精度下仅能支持 6k 上下文,q80 精度下为 12k。
作为对比,他指出 Qwen 3.6 MoE 在相近条件下仅需 1.2GB 显存即可运行 64k 的 f16 上下文。因此,对于低配设备,作者认为继续使用 Qwen 系列的紧凑型模型是更优选择。
「模型」频道最新
- Opus 5 体验:技术极强但对话僵硬,更适合做智能体而非创意助手 — MicahBerkley · 2026-07-28
- 月之暗面开源 Kimi K3:2.8T 参数 MoE,原生视觉与百万上下文 — max_paperclips · 2026-07-28
- Kimi K3 在利用开发上胜过 GLM-5.2,但端到端仍未攻成 — kevinsxu · 2026-07-28
- 大模型更像“智慧”,推理努力更像“勤奋” — breath_mirror · 2026-07-28
- 微软发布自研AI安全模型,关键测试超越GPT且成本减半 — MichaelFNunez · 2026-07-28
- 实测对比:K3等模型推理token极易耗尽预算 — MaziyarPanahi · 2026-07-28