IBM 的 STAIR 用书籍目录做检索索引,82.6% 命中、幻觉率仅 0.05%

alex_verem · x · 2026-09-26

IBM Research 的 STAIR(STructure Aware Information Retriever)论文提出:与其把长文档切成等长 chunk 做向量检索,不如直接利用文档自带的全局结构(如目录)作为索引,让模型学会用章节标题直接回答问题,从而跳过 embedding 和向量数据库。

团队构建了覆盖法律、医学、金融、教育、科学等领域的 18 本书、数万问题的基准 SearchTome。STAIR 的 Recall@1 达 82.6%,最佳对比方法 76.9%,稠密检索 68.7%,关键词检索 59.5%,开箱 Mistral 仅 13.8%。指向不存在章节的幻觉率为 0.05%,最接近的对比方法是 3.25%。

限制也需要注意:需要文档有目录;团队对每本书单独微调一个 7B 模型、每本跑 200 个 epoch;尚未在企业级文档集合上验证。论文未测试基于该章节生成的答案本身是否正确。

所属事件:IBM 提出 STAIR 检索法:用文档目录索引替代向量 RAG(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →