用小模型给每段文本打 4 个概率,实现比 LLM 摘要更省的 RAG 过滤与上下文压缩

marlene_zw · x · 2026-09-23

作者分享在 Copilot SDK 里做上下文压缩的实践:用 Jev 模型对每段文本输出多个概率并按阈值决策——P(relevant)<0.45 丢弃、P(has answer)>0.55 保留;进一步尝试 4 级打分:对目标是否仍需要、是否被后续活动取代、是否还会再被需要。虽然最终输出仍需人工评估,但比用 Opus 或 GPT 做一次性摘要更便宜、更快。

所属事件:用小模型打概率分管理 RAG 与 Agent 上下文(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →