BeaconKV:用信标查询预测 KV 缓存复用,压缩长推理链显存
Janghyeon Kim · hf · 2026-09-09
BeaconKV 提出面向大型推理模型的 KV 缓存压缩方法:用紧凑的「信标查询」(beacon queries)预测哪些历史 key-value 对在后续推理中会被重新访问,据此选择性保留缓存,在不牺牲准确率的情况下显著降低长思维链推理的显存开销。
「Infra」频道最新
- 一个 flag 就能用 vLLM 服务任意 Transformers 模型,无需手写移植 — ariG23498 · 2026-09-09
- OpenAI 高管称 Astra 需求空前,GPT-6 用量若续涨或暂停新增 Pro 订阅 — op7418 · 2026-09-09
- 本地跑 AI 只需搞懂 4 件事:模型、Hugging Face、运行器与量化 — Roger_M_Taylor · 2026-09-09
- Google 称 AI 服务器回本周期不到两年,自研芯片仅一年 — SumitGup · 2026-09-09
- Together 称 GLM-5.3 Flash 跑分超 Claude Fable 5.1,成本仅约 1% — togethercompute · 2026-09-09
- HN 热议:Cloudflare 技术架构师 Lee Holloway 传记首篇 — porridgeraisin · 2026-09-09