AWS 揭秘查询感知压缩:降低 RAG 成本的新范式
AWS ML Blog · rss · 2026-08-22
在 Amazon Bedrock 上运行大规模 RAG 应用时,输入 Token 往往占据主要成本。本文提出了一种“查询感知压缩”架构,通过在检索后、主模型回答前插入一个小模型(如 Claude Haiku)来过滤并提取检索文档中与问题相关的原文片段,从而大幅减少发送给主模型(如 Claude Sonnet)的上下文量。
核心架构与流程:
- 检索:Retriever 搜索并向量索引返回 Top-k 文档块。
- 压缩:AWS Lambda 函数将查询和检索块发送给低成本小模型,要求其仅输出与问题逐字相关的证据片段(禁止改写)。
- 生成:Lambda 将“压缩后的上下文”和查询发送给主模型生成最终答案。
经济性分析:
当检索上下文较大、大小模型价格比高(如 Sonnet/Haiku)且能无损修剪内容时,此模式能显著降低成本。文章给出了具体的成本公式,对比了压缩前后的费用构成。
实现要点:
- 提供了完整的 COMPRESSIONSYSTEMPROMPT,强调提取 Verbatim spans 而非总结。
- 代码示例展示了如何在 AWS Lambda 中使用 Bedrock Converse API 协调两次模型调用。
- 提及该模式可与 Prompt Caching、Intelligent Prompt Routing 及 Rerank API 叠加以进一步优化。
「Infra」频道最新
- 西弗吉尼亚拟用数据中心收入取消州所得税 — beffjezos · 2026-08-22
- 挖出 OpenAI 架构:MCP、视频工具与广告基建子域名曝光 — imjustnewatai · 2026-08-22
- a16z 数据:所在县建数据中心后房价就业双升 — a16z · 2026-08-22
- NVIDIA 优化 MiniMax H3:单卡 GB200 每月产 37.8 万个视频 — songhan_mit · 2026-08-22
- 2026 年端侧小模型选型:Gemma 4 与 Qwen3.5 — lmoroney · 2026-08-22
- 网友提议将海上石油平台改造成数据中心 — beffjezos · 2026-08-22