研究称Agentic RAG评测预算应优先多覆盖问题

arXiv 一项新论文研究 Agentic RAG 评测中的 token 预算最优分配问题,即预算应花在更多问题、更多搜索轨迹还是更多重复读取上。基于 HotpotQA 与 MuSiQue 的检索反馈对比实验发现,将预算用于覆盖更多问题而非增加重复读取,可使评测标准误降低约 33%,为评测设计提供了明确指导。

2026-10-06 ~ 2026-10-08 · 2 条相关