JPMorgan 用增量池化 LLM 评测降检索选型成本最高 4.9 倍
_reachsumit · x · 2026-09-03
JPMorganChase 团队在 arXiv 发布论文,提出一种增量池化 LLM 评测方法,用于低成本地为生产级 RAG 系统选检索模型。
- 核心思路:让 LLM 对所有候选检索系统返回文档的并集做相关性判定;新系统加入时只判其新增文档,判定结果复用于所有系统。
- 验证:在 4 个检索基准、11 个系统(dense/sparse/hybrid)上验证,并部署于金融新闻 QA 系统对比 62 个检索配置。
- 效果:与金标准评测的排序高度一致,考虑 bootstrap 不确定性后 97% 的两两排序保持;生产中文档重叠带来 65–80% 的判定复用,评测成本最多降低 4.9 倍。
- 结论:池化 LLM 评测是在线检索模型增量选型的实用且经济的工作流。
「研究」频道最新
- 用机制设计做 AI 对齐:新框架直击 sandbagging 与对齐伪装 — DavideCrapis · 2026-09-03
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03
- 推友激辩:CoT 提示是不是一种参数复用? — aryaman2020 · 2026-09-03
- LL(1) 语法约束解码实测:消除 Agent 语法错误,高层失误仍在 — Upstairs-Special-925 · 2026-09-03