单卡 H100 实现 5000 万 token 记忆:KV 状态复用快 4 倍省电 12 倍
Corbenci · hf · 2026-10-09
Hugging Face 上的实测报告介绍开源包 galahad-kv:把每段约 1.6 万 token 的 KV 状态加密存到本地 NVMe,之后字节级精确读回,避免每次重新计算。
测试设置
- 5000 万 token 真实公开文本,vLLM 服务,单张 H100,Gemma 4 12B 与 31B
- 100/100 个探测块全部从加密存储读回、零重算(深度覆盖 0–50M token)
结果
- 读回比重算快 2.8–4.3 倍,GPU 能耗低 8.8–12.3 倍,显存占用全程平稳
- 追问数百万 token 前埋下的事实时,12B 答对 82/100,31B 答对 98/100,均无编造
限制:这是存储状态复用而非更宽的注意力窗口,一次只加载一个块;写入是一次性成本,存储需 TB 级本地 NVMe。测试协议设计抗长上下文基准刷分,并提供单卡复现方案。
「Infra」频道最新
- 极客级隐私栈:searxng 藏在 67 层代理链后仅走 tailnet — haydendevs · 2026-10-09
- GlobalFoundries 与台积电签 5 年协议,美国首产硅中介层 — teortaxesTex · 2026-10-09
- NVIDIA 推 RTX Spark 设备:本地微调大模型、跑 AI Agent 一站搞定 — danielhanchen · 2026-10-09
- Air Street 资本:冲前沿失败的 AI 公司正转型做数据中心服务中国模型 — johncoogan · 2026-10-09
- Domingos 断言中国数据中心容量将快速超越美国 — pmddomingos · 2026-10-09
- 数据中心该搬去海上?Soham 发布海洋算力成本模型与交互仪表盘 — nwilliams030 · 2026-10-09