RandKV 开源:把 Random Attention KV 缓存驱逐策略做成 pip 一键可用
atease01 · reddit · 2026-09-07
开发者发布了 RandKV,一个可 pip 安装的 Transformers KV 缓存随机驱逐策略实现,源自复现 Random Attention 论文的需求。
- 实现要点:保护完整 prompt、保留近期 token 缓冲区、对每个 KV head 独立采样较旧的生成 token;绝对序列位置与压缩后的物理缓存长度分离,种子由请求、驱逐轮次、层和 head 决定性地派生。
- 诚实报告负面结果:在 Apple M4 上对 Qwen3-0.6B 测试,当前 Python/PyTorch 压缩路径只有 35.48 tok/s,对比 dense 的 38.53 tok/s(0.921 倍)——说明这是兼容性与适配层开销的证据,并非论文所述 vLLM 吞吐提升的验证。
- 范围限制:仅支持 Transformers 5.16、batch size 1、全注意力解码模型,无 beam search 和 vLLM 后端。
下一步是带匹配质量与 serving 基准的 CUDA/vLLM 后端,作者征求缓存接口与基准设计的反馈。
「Infra」频道最新
- 928 星 Wiki:无 NVLink 在 PCIe RTX 6000 上跑 397B 大模型 — TheZachMueller · 2026-09-07
- 预测:算力正从机架级迈向数据中心级,瓶颈转向周边一切 — AccBalanced · 2026-09-07
- AI 圈新梗:刷牙关水龙头,「为数据中心省水」 — EigenGender · 2026-09-07
- AMD MI355X 在 AgentX 上每美元 token 数击败 B300 — AccBalanced · 2026-09-07
- 为无网村庄置办本地 LLM:5 千美元预算选卡求建议 — Potential_Low_1183 · 2026-09-07
- 开发者自制 llama.cpp 分支,让 MoE 模型支持专家数量扩展 — Specific-Tax-6700 · 2026-09-07