Agens Volundr 32B 亮相:仅 18 层留 KV 缓存,128K 上下文只慢 5%

lmoroney · x · 2026-10-08

香港团队 Blockway 在 Hugging Face 以 Apache 2.0 开源 Agens Volundr 32B Preview,主打压缩长上下文的显存开销。72 层中仅 18 层保留 KV cache:54 层用固定状态线性注意力 Kimi Delta Attention,17 层用 4096 token 滑窗加压缩远场,1 层全注意力。官方在两张 48GB GPU 上实测,上下文从 1K 到 128K 时解码速度仅从 25.1 降至 23.9 token/s,INT4 版本可塞进单张 48GB 卡。短板也很坦诚:50 个 SWE-bench 任务中 36 个出现重复循环,且目前依赖自家 sglang 构建,尚无 vLLM 插件。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →