BeaconKV:用信标查询预测 KV 缓存复用,压缩长推理链显存

Janghyeon Kim · hf · 2026-09-09

BeaconKV 提出面向大型推理模型的 KV 缓存压缩方法:用紧凑的「信标查询」(beacon queries)预测哪些历史 key-value 对在后续推理中会被重新访问,据此选择性保留缓存,在不牺牲准确率的情况下显著降低长思维链推理的显存开销。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →