IBM STAIR 论文:把书籍目录当作索引,检索命中率 82.6%、幻觉低 65 倍
alex_verem · x · 2026-09-26
IBM Research 的 STAIR(STructure Aware Information Retriever)论文重新思考了长文档检索:
- 问题:传统 RAG 把文档切成等长 chunk 丢给向量库,过程中丢掉了章节、标题等语义结构,500 页手册变成一堆散落段落
- 方法:STAIR 保留文档结构,模型读取目录、学会用正确的章节标题作答——书籍大纲本身就是最好的索引,无需 embedding 和向量库
- 基准:团队用 18 本书(法律、医学、金融、教育、科学)构建 SearchTome 基准,含数万个问题
- 结果:STAIR Recall@1 达 82.6%,最佳对比方法 76.9%,稠密检索 68.7%,关键词搜索 59.5%,开箱 Mistral 仅 13.8%;幻觉率 0.05%,最接近方法为 3.25%(即「65 倍」的出处)
作者同时指出病毒传播中被忽略的限制:STAIR 需要文档带目录;每本书单独微调 7B 模型、跑 200 个 epoch;未在企业规模文档集合上测试;论文也未验证基于章节生成的答案是否正确。
核心洞见:作者花几个月组织成的章节结构,是现成的最佳索引——而大多数 AI 搜索恰恰忽略了它。
所属事件:IBM 提出 STAIR 检索法:用文档目录索引替代向量 RAG(3 条相关)→
「研究」频道最新
- Claude 无监督跑数天,粒子物理散射振幅计算首破九圈纪录 — AnthropicAI · 2026-09-26
- 「grep 就够了」与「BM25 就够了」两篇论文先后中稿 — lintool · 2026-09-26
- Greenblatt 发文警告:潜空间推理架构将大幅推高对齐风险 — anmarasovic · 2026-09-26
- Huszár 团队发 TLA+ 实战教程:形式化验证非银弹,正用 AI 补齐 — fhuszar · 2026-09-26
- 双层优化利用无标注数据,破解分子性质预测 OOD 泛化难题 — CatAstro_Piyush · 2026-09-26
- 用 Blender 造 1 万+样本,世界模型首次系统性训练客体永久性 — _akhaliq · 2026-09-26