Agentic RAG评测预算研究:多覆盖问题比多读省33%标准误
CarnegieMellonU · hf · 2026-10-08
该论文研究 agentic RAG 评测预算在问题数、搜索轨迹与重复读取间的最优分配,基于 HotpotQA 与 MuSiQue 的检索反馈对比。
关键发现:
- 在约 34.1–34.4M 模型 token 预算下,扩大问题覆盖比五次读取降低 33% 标准误,比三条轨迹降低 12.6%
- 归档的嵌套与仅问题预测可将分配预测误差控制在 4.0% 与 3.5% 内;两条轨迹审计之外未见明确预测优势
- 同 token 预算下单次读取相对拟合最优的方差惩罚为 0–9.9%
- 按记录的模型费用,搜索价格在每千请求 $0–1 时「多问题」优于「多轨迹」;问题与读取的费用排序尚未定论
- 温度设 0 将答案不一致率从 14.3% 降至 3.4%,对比精度相近
所属事件:研究称Agentic RAG评测预算应优先多覆盖问题(2 条相关)→
「编程与Agent」频道最新
- 一套六个 AI agent 组成的个人工作流:从购物到用 agent 创业 — Teknium · 2026-10-08
- AI 虚拟角色 Claudia 开源人格包:MCP 服务器+技能+角色设定全可下载 — Promptmethus · 2026-10-08
- 开发者用 AI 加 asc cli 自动打包提交 App,「睡一觉审核就过了」 — rudrank · 2026-10-08
- HKU 递归游戏创作器:以体验为导向的智能体游戏开发框架 — hkuhk · 2026-10-08
- Polyphonic 陪伴式 Agent 能力清单:追踪屏幕活动、记忆关系还能自主立项 — RileyRalmuto · 2026-10-08
- 469 题实测 Qwen3.8-27B 微调:本地最佳版比 Opus 5.5 慢 28 倍但更省 token — norenEnmotalen · 2026-10-08