研究:Agentic RAG 评测预算花在多问问题上,误差降 33%
_reachsumit · x · 2026-10-06
arXiv 论文研究 Agentic RAG 评测中的 token 预算分配问题:预算应花在更多问题、更多搜索轨迹还是更多重复读取上。
- 在 HotpotQA 和 MuSiQue 上用检索反馈对比实验测量分配精度、读取效率与成本边界。
- 在约 34.1–34.4M 模型 token 的等成本下,扩大问题覆盖面比做五次读取降低 33% 标准误,比做三条轨迹降低 12.6%。
- 归档的嵌套预测与仅问题预测能分别在 4.0% 和 3.5% 内预测最优分配。
- 同预算下单次读取相对拟合最优的方差惩罚为 0–9.9%;在每千次请求 $0–1 的搜索价格下,多问问题优于多轨迹。
- 温度设 0 将答案分歧率从 14.3% 降到 3.4%,对比精度基本不变。
所属事件:研究称Agentic RAG评测预算应优先多覆盖问题(2 条相关)→
「研究」频道最新
- OpenAI 数学仓库更新:约 42% 顶线结果已 Lean 形式化,3 篇撤稿 — danintheory · 2026-10-08
- 用流体造计算机:作者动手模拟 OpenAI 论文中的 Navier–Stokes 图灵机 — kfountou · 2026-10-08
- D-OPCD 把 Agent 经验蒸馏进扩散模型权重,四基准平均分升至 65.09 — Wenxuan Wang · 2026-10-08
- 四叉树视觉分词器 QuadTok:省 10% token,ImageNet 达 2.08 gFID — Yucheng Mao · 2026-10-08
- PhysEvo 让冻结模型物理递归自我改进:RoboDojo 42 任务成功率 62% — Wenqing Tian · 2026-10-08
- RL 视角解释 On-policy 蒸馏崩溃:隐性奖励被 hack 导致冗长重复输出 — Han Cui · 2026-10-08