AWS 揭秘查询感知压缩:降低 RAG 成本的新范式

AWS ML Blog · rss · 2026-08-22

在 Amazon Bedrock 上运行大规模 RAG 应用时,输入 Token 往往占据主要成本。本文提出了一种“查询感知压缩”架构,通过在检索后、主模型回答前插入一个小模型(如 Claude Haiku)来过滤并提取检索文档中与问题相关的原文片段,从而大幅减少发送给主模型(如 Claude Sonnet)的上下文量。

核心架构与流程:

经济性分析:

当检索上下文较大、大小模型价格比高(如 Sonnet/Haiku)且能无损修剪内容时,此模式能显著降低成本。文章给出了具体的成本公式,对比了压缩前后的费用构成。

实现要点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →