用小模型打概率分管理 RAG 与 Agent 上下文
多位开发者分享用小模型为文本段落打多个概率分数的实践:在 RAG 检索与生成之间,TypeSafe 针对每个 query-段落对同时回答四个问题(是否相关、是否含答案、是否矛盾、是否在诱导注入)实现抗注入过滤;另有作者用 Jev 模型按阈值决策丢弃或保留段落,并以此管理 Agent 上下文,判断每段是否仍需要或已被取代。相比用 Opus 或 GPT 做一次性摘要,这种方式更省更快。
2026-09-23 ~ 2026-09-23 · 3 条相关
- TypeSafe 用单次调用给 RAG 段落打概率分,自动留删抗注入 — marlene_zw · 2026-09-23
- 用小模型给每段文本打 4 个概率,实现比 LLM 摘要更省的 RAG 过滤与上下文压缩 — marlene_zw · 2026-09-23
- 用小模型打分管理 Agent 上下文,比一次性摘要更省更快 — marlene_zw · 2026-09-23