香港小团队开源 32B 混合架构模型:72 层仅 18 层保留 KV 缓存
ComfortableKindly507 · reddit · 2026-10-05
香港团队 Blockway 发布 Apache-2.0 开源的 Agens Volundr 32B Preview,首个自研混合架构模型,主打长上下文下的 KV 缓存压缩——上下文越长,决定显存占用的往往是 KV 缓存而非权重。
架构(72 层 dense 32B):
- 54 层 KDA(线性注意力,固定大小循环状态,无 KV 缓存)
- 17 层自研 BCSA 压缩稀疏注意力:精确窗口覆盖最近 4K token,更早上下文 4:1 池化分块,学习型索引器读取 top 512 块
- 1 层全注意力(第 72 层)
- Engram:驻留主机内存的哈希 n-gram 记忆,挂载在 2 层
- mHC:4 条残差流
性能:仅 18/72 层保留 KV 缓存,262K 上下文。BF16 双 48GB GPU 解码从 1K 到 128K 上下文速度几乎不掉(25.1→23.9 tok/s);INT4 单卡 31.7GiB。DFlash2 草稿器带来最高 3.6x JSON/工具输出加速(≤8 并发时有效)。
评测:LiveCodeBench v6、HumanEval、AIME 2025、MATH-500 领先 Qwen3.8-27B,MMLU-Pro/GPQA 持平;Agent 类任务是短板(tau2-bench 74.2 vs 79-80,SWE-bench 子集 44 vs 58-64),v1 版将继续预训练约 10B token 并加入长 agent 会话训练。限制:需其自建 sglang 才能加载,暂无 GGUF/llama.cpp 支持。
「模型」频道最新
- RLHF 联合发明人推出机器专用模型 Jev,70-500ms 返回决策 — DavidLinthicum · 2026-10-05
- Tau Scaling 走向主流,本周开局就打破叙事 — kevinsxu · 2026-10-05
- Grok 聊天内上线交互式可视化,图表不再是一张静态图 — nima_owji · 2026-10-05
- 有人提议建「你见过这个模型吗」站点追踪模型下线 — repligate · 2026-10-05
- OpenAI 为何把 dots 功能锁进 100 美元 Pro 订阅? — kimmonismus · 2026-10-05
- Mac Studio M5 Ultra 256GB 跑 GLM 5.3 Flash 达 68.8 tok/s — cryotic · 2026-10-05