RAG 全栈工程技巧总结
thisguyknowsai · x · 2026-07-11
这条长线程总结了一个 RAG/检索式 agent 的“全栈”做法,核心是让检索更适配推理过程,而不是只做最基础的 top-k 召回。
包含的要点有:
- 语义边界切分:按完整思想/步骤切块,而不是按字符数。
- 分层索引:摘要、chunk、句子三层索引分别服务不同粒度问题。
- 上下文感知重排:结合对话历史而不只是当前问题打分。
- 按推理步骤触发检索:每一步都判断是否还需要补充上下文。
- 负空间注入:告诉模型“文档里没有什么”,减少幻觉。
- 压缩后再注入:先检索完整 chunk,再压缩到与查询相关的句子。
- 跨文档冲突检测:如果不同来源互相矛盾,先标记冲突。
- 检索审计:记录每次检索的置信度和原因,让模型能“看见”自己的检索轨迹。
作者的主张是:很多 RAG 教程只讲演示路径,真正上线时失败往往不是因为“检索不到”,而是上下文注入方式让模型更混乱。
所属事件:RAG系统进阶指南:解决上下文污染的八大工程技巧(20 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11