K2 Horizon 全系上架 AA,实测 KV cache 设计拖累参数效率

crusaderky · reddit · 2026-09-14

K2 Horizon 全系模型已上架 Artificial Analysis,作者认可 AA 智能指数(0.9B 与 375B 表现差;3.7B 与 7B 达 SOTA;36B A4B 适合低内存带宽硬件),但指出其 KV cache 设计糟糕,按参数量选型会被严重误导。

作者给出 Q4KM 量化、无 drafter、128k 上下文下的实际内存占用:

对比 Qwen3.6-35B-A3B(上下文仅 0.7 GiB)和 MiniCPM5-2B(1.5+1.5 GiB)。

选型建议:36B-A4B 只在恰好 16GB VRAM + ≥32GB 内存时有趣;24GB VRAM 下 Qwen3.8-27B 更快更聪明且支持 256k;7B 适合 16GB VRAM 与 32GB 内存 Strix Halo;3.7B 或许适合 12GB 手机但 MiniCPM5-2B 体验更好。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →