香港小团队开源 32B 混合架构模型:72 层仅 18 层保留 KV 缓存

ComfortableKindly507 · reddit · 2026-10-05

香港团队 Blockway 发布 Apache-2.0 开源的 Agens Volundr 32B Preview,首个自研混合架构模型,主打长上下文下的 KV 缓存压缩——上下文越长,决定显存占用的往往是 KV 缓存而非权重。

架构(72 层 dense 32B):

性能:仅 18/72 层保留 KV 缓存,262K 上下文。BF16 双 48GB GPU 解码从 1K 到 128K 上下文速度几乎不掉(25.1→23.9 tok/s);INT4 单卡 31.7GiB。DFlash2 草稿器带来最高 3.6x JSON/工具输出加速(≤8 并发时有效)。

评测:LiveCodeBench v6、HumanEval、AIME 2025、MATH-500 领先 Qwen3.8-27B,MMLU-Pro/GPQA 持平;Agent 类任务是短板(tau2-bench 74.2 vs 79-80,SWE-bench 子集 44 vs 58-64),v1 版将继续预训练约 10B token 并加入长 agent 会话训练。限制:需其自建 sglang 才能加载,暂无 GGUF/llama.cpp 支持。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →