K2 Horizon 全系上架 AA,实测 KV cache 设计拖累参数效率
crusaderky · reddit · 2026-09-14
K2 Horizon 全系模型已上架 Artificial Analysis,作者认可 AA 智能指数(0.9B 与 375B 表现差;3.7B 与 7B 达 SOTA;36B A4B 适合低内存带宽硬件),但指出其 KV cache 设计糟糕,按参数量选型会被严重误导。
作者给出 Q4KM 量化、无 drafter、128k 上下文下的实际内存占用:
- 36B-A4B:2 GiB 稠密权重 + 19 GiB 专家 + 6.7 GiB 上下文
- 7B:5.2 GiB 权重 + 5 GiB 上下文
- 3.7B:2.9 GiB 权重 + 5 GiB 上下文
对比 Qwen3.6-35B-A3B(上下文仅 0.7 GiB)和 MiniCPM5-2B(1.5+1.5 GiB)。
选型建议:36B-A4B 只在恰好 16GB VRAM + ≥32GB 内存时有趣;24GB VRAM 下 Qwen3.8-27B 更快更聪明且支持 256k;7B 适合 16GB VRAM 与 32GB 内存 Strix Halo;3.7B 或许适合 12GB 手机但 MiniCPM5-2B 体验更好。
「Infra」频道最新
- 510GB 模型跑进 128GB 小机器:DeepSeek 新模型端侧加载妙招 — pbaylies · 2026-09-14
- Meta 深度解析 ZGateway:代理层使 ZippyDB 每主机连接数降 97-98% — Meta_Engineers · 2026-09-14
- PufferLib 5.0 训练提速 5 倍,峰值吞吐超 6000 万步/秒 — jsuarez · 2026-09-14
- PufferLib 5.0 抛弃 Python:万行 CUDA C 实现五层并行确定性训练 — jsuarez · 2026-09-14
- Baseten 工程师免费开放《Inference Engineering》全书在线阅读 — philipkiely · 2026-09-14
- 马斯克披露 xAI:预训练用自研 C/C++ 栈,强化学习栈仍是「遗留烂摊子」 — jsuarez · 2026-09-14