Agens Volundr 32B 亮相:仅 18 层留 KV 缓存,128K 上下文只慢 5%
lmoroney · x · 2026-10-08
香港团队 Blockway 在 Hugging Face 以 Apache 2.0 开源 Agens Volundr 32B Preview,主打压缩长上下文的显存开销。72 层中仅 18 层保留 KV cache:54 层用固定状态线性注意力 Kimi Delta Attention,17 层用 4096 token 滑窗加压缩远场,1 层全注意力。官方在两张 48GB GPU 上实测,上下文从 1K 到 128K 时解码速度仅从 25.1 降至 23.9 token/s,INT4 版本可塞进单张 48GB 卡。短板也很坦诚:50 个 SWE-bench 任务中 36 个出现重复循环,且目前依赖自家 sglang 构建,尚无 vLLM 插件。
「Infra」频道最新
- WSJ:博通为 OpenAI 自研芯片筹逾 500 亿美元融资,内部项目代号 Nexus — rohanpaul_ai · 2026-10-08
- Scaling laws 到极限了吗?Reddit 求解当前 AI 扩展现状 — StupidDialUp · 2026-10-08
- TRIAGE 方法修复 NVFP4 量化 RL 训练不稳,吞吐达 BF16 的 2.3 倍 — InfiX-ai · 2026-10-08
- WSL 容器功能正式 GA:一条命令在 Windows 上跑 Linux 容器 — pavandavuluri · 2026-10-08
- ai& 自称日本最大推理服务商,披露数据中心与后训练布局 — DavidBennett__ · 2026-10-08
- 微软发布 Surface Laptop Ultra:首搭 RTX Spark,2599 美元起 — Ars Technica AI · 2026-10-08