IBM 用目录做寻址,STAIR 生成式检索 Recall@1 达 82.6%
omarsar0 · x · 2026-09-07
IBM 的 STAIR 论文针对 RAG 的一个老问题:检索器按长度切分长文档,丢掉了文档原有的层级结构。
核心思路:
- 用文档的目录(ToC)作为寻址方案,精确编码被切分丢弃的全局结构。
- ToC 作为生成式检索器的地址空间,模型在自己的参数中存储信息,并按语料提供的结构进行检索。
评测结果(新基准 SearchTome):
- Recall@1:STAIR 82.6%,显著超过微调后的可微搜索索引 76.9%,远超 BM25 的 59.5% 与 DPR 的 68.7%。
- 幻觉率低于 0.05%,回应了生成式检索长期被诟病的幻觉问题——地址空间锚定在语料结构上是关键。
「研究」频道最新
- MUCG 多模态统一理解与生成研讨会将亮相 ECCV 2026 — jmin__cho · 2026-09-07
- 雷达点云分类:点密度才是瓶颈,F1 从 0.381 翻倍至 0.764 — bruno_pinto90 · 2026-09-07
- AI 数学播客对话 CMU 教授 Avigad:数学能否被自动化 — EchoShao8899 · 2026-09-07
- 「The honest claim」成预印本高频词,暴露AI代写痕迹 — lpachter · 2026-09-07
- ML 研究可复现性正走向失效:三大诱因讨论引热议 — NeighborhoodFatCat · 2026-09-07
- GPT Astra 三试其一解决 1962 年 Erdős–Sós 猜想,仅花 363 美元 — burny_tech · 2026-09-07