Galahad 让 LLM 读文档只算一次:98.7% 提示词是重复文本
Sietse Schelpe · hf · 2026-10-01
LLM 服务默认跨请求无状态:同一文档的第二个问题也要从第一个 token 重算注意力状态。实测七个真实数据集,98.7% 的提示词 token 是模型已读过的文本。
Galahad 是给 vLLM、SGLang、llama.cpp 用的记忆层,把'读'变成一次性成本:
- Taliesin:按字节精确保存并复载文本块的 KV 状态,重启后 262,144 个输出 logits 全部 bit 级一致
- Blaise:保留文档本身,按需只传模型所需段落
- 97,000 token 语料藏 100 个事实的测试:仅 Taliesin 即答对 98/100(3.0s、572J/题,无记忆基线 10/100、9.3s、2754J);加 Blaise 后三运行时全对,0.59-0.64s、200-213J,每题仅读约 668 token;调优 RAGFlow 仅答对 77
- 语料入库一次性成本约 100s 与 28kJ,答 13 题即回本;实测兼容 30 个模型,校验失败即回退重算,故障关闭
「Infra」频道最新
- DeepSeek 开源 TileKernels:数十个接近硬件极限的 LLM 算子库 — rohanpaul_ai · 2026-10-01
- DeepSeek 开源六个华为昇腾项目,矩阵算子达芯片峰值 99.8% — rohanpaul_ai · 2026-10-01
- Meta 首个 Loop MoE Scaling Law:稀疏省 3 倍、循环省 2 倍算力 — facebook · 2026-10-01
- 87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s — CurieuxExplorer · 2026-10-01
- GPU 基础设施采购指南:「通过测试」到底测了什么? — AccBalanced · 2026-10-01
- Vox 长文:数据中心重镇电价 2019-2024 反而下降 — kevinnbass · 2026-10-01