REFRAG 让 KV 缓存跨 prompt 复用,但 16x 压缩也救不了「全库进上下文」

CShorten30 · x · 2026-10-05

CShorten30 在 podcast 讨论中澄清了 prompt caching 与向量数据库的关系,并讨论了 REFRAG 的思路:

完整讨论见其围绕 Sparse Attention 与 Vector Databases 的 podcast 节目。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →