AutoIndex:用可执行的表示程序优化检索,8 项任务召回率平均提升 8.4%
CShorten30 · x · 2026-09-14
UMass Amherst 与 Databricks Mosaic Research 发布论文《AutoIndex: Learning Representation Programs for Retrieval》。核心思路是不再只调 retriever/reranker,而是把“文档如何变成索引表示”本身当作显式优化目标:
- 搜索可执行程序:对原始文档做切片、增强、归一化、重加权、重组等变换后再索引
- 闭环优化:每轮由 agent 诊断检索失败原因、合成候选程序、重建索引,只保留在验证集 Recall@100 上真实提升的更新
- 在异构检索基准 CRUMB 上评测,BM25 保持不变,学习到的程序在全部 8 个任务上提升召回,平均 +8.4% Recall@100、+8.3% nDCG@10,最高 +30.5% 与 +43.6%
- 结论:文档表示不应是检索开始前的固定预处理选择,而应是可搜索的优化对象
论文、代码与 arXiv 预印本均已放出。
「研究」频道最新
- KAIST 提出PLC-DPO:用后验校正处理含噪偏好标签 — kaist-ai · 2026-09-14
- 腾讯混元开源SAS:端到端训练稀疏注意力上下文排序 — Tencent-Hunyuan · 2026-09-14
- 新加坡国立大学 LIT 方法破解机器人视觉-动作捷径泛化难题 — NationalUniversityofSingapore · 2026-09-14
- 港中深 COBRA-Skills:上下文赌臂引导 LLM 智能体技能进化 — CUHKSZ · 2026-09-14
- 代码知识图谱检索省 75-82% token,但作者承认没测准确率 — coding-os · 2026-09-14
- 博士生让 AI 读 1112 张组织切片,研究七种器官不同衰老速度 — anantm · 2026-09-14