Galahad 让 LLM 读文档只算一次:98.7% 提示词是重复文本

Sietse Schelpe · hf · 2026-10-01

LLM 服务默认跨请求无状态:同一文档的第二个问题也要从第一个 token 重算注意力状态。实测七个真实数据集,98.7% 的提示词 token 是模型已读过的文本。

Galahad 是给 vLLM、SGLang、llama.cpp 用的记忆层,把'读'变成一次性成本:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →