EMBL 开源生命科学文献检索层:不建向量库,Citation F1 比基线高 16 分以上

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

cs.CL, cs.AI, cs.IR, cs.LG

2026-07-30

EMBL 给 Europe PMC 套了一层 LLM 编排的检索接口,agent 用自然语言提问就拿回可引用的证据。四个生命科学基准上引用 F1 比已发表基线高 16 分以上,LitQA2 准确率比联网搜索高 8.6 分。

这篇在解决什么

生命科学的 AI agent 几乎都绕不开一件事:把推理锚定在已发表的论文上。无论是跨多篇文献写综述、给科学主张做真假核实,还是生成可检验的假设,agent 都得先找到证据。可现有的文献接口是给人用的,不是给 agent 用的。

Europe PMC 是生命科学的开放检索引擎,收录 4070 万条 PubMed 摘要、1190 万篇全文、120 万预印本。它的查询接口要关键词和复杂语法,返回的是整篇文章。生物实体又有大量别名:同一个 TP53 基因也叫 p53,肌萎缩侧索硬化(ALS)有一长串同义词和 MeSH 受控词。agent 要么学一套查询语法,要么连发多个互补查询把不同写法都覆盖到;拿到结果后还得读整篇论文挑证据,而每篇全文都在吞噬它有限的上下文窗口。

常见的解决办法是建一个稠密向量库:把论文切成段落、做嵌入,agent 用自然语言查最近邻。这条路毛病不少。第一,贵:索引和服务整个文献库要几百 GB 的嵌入,OpenScholar 的库就有 744 GB。第二,随着大模型变强,稠密检索相对词法检索(BM25)的优势在收窄,一个被强模型驱动的 BM25 关键词检索在科学基准上已经能追平甚至超过稠密检索。第三,嵌入把结构化元数据压平了,没法直接按基因、蛋白、物种、化学物质这些字段过滤。第四,向量最近邻没法审查,不像结构化关键词查询那样能看懂它是怎么查到的。

方法

EMBL AI Librarian 的核心选择是不建自己的索引,直接查 Europe PMC 的在线检索,用一个 LLM 把整条检索流程编排起来。系统与模型无关,任何 LLM 都能当控制器,模型升级了系统自动受益。实验里用的是自托管的 GLM-5(约 7000 亿参数),跑在 NVIDIA DGX B200 上。

它分三步,从「重召回」逐步过渡到「重精度」。

整个接口的粒度比传统检索细得多:它返回句子级的证据片段,不是整篇文章,下游 agent 可以直接引用、标注来源、在上面推理。

结果

在四个互补的基准上,装上 Librarian 的 agent 普遍变强。

文献综述(ScholarQABench):

设置(综述 agent = GLM-5)Citation F1 BioCitation F1 Neu
OpenScholar-70B(已发表)55.963.1
PaperQA2(已发表)56.756.0
本 agent + BM25(OSDS)67.068.5
本 agent + Librarian73.879.4

换上 Librarian 后,Bio 比已发表的 OpenScholar-70B 高 17.9 分,Neu 高 16.3 分,这就是摘要里说的「16 分以上」。即便在同一个 agent 内部、只换检索器,Librarian 也比 BM25 基线在 Bio 上高 6.8 分、Neu 上高 10.9 分。多学科题(Multi)的 LLM 评分从 4.10 涨到 4.90,提升约两成。

主张核实(ProClaim-eval,agent 都是 Claude Sonnet 4.6):ProClaim 流水线换上 Librarian 做证据检索,与专家共识的一致率从 0.75 升到 0.80(+5);连一个单 prompt 的极简核实 agent,配上 Librarian 都能做到 0.66,比从 PubMed 和 Semantic Scholar 检索高 15 分。基线 OpenScholar 只有 0.43。

开放域问答(开放形式 LitQA2,同一个 GPT-5.4 骨干):不检索只靠参数知识时准确率只有 17.6,幻觉严重;接联网搜索升到 70.3;换成 Librarian 再升到 78.9(+8.6),精度和覆盖也同步上升。这个对比换了检索器没换模型,干净地隔离了检索器的贡献。

生物学基础任务(LAB-Bench):在更强模型 GPT-5.4 上,Librarian 主要靠拉高覆盖把宏平均准确率从 50.5 抬到 54.6(+4.2),序列操作题(SeqQA)准确率从 52.5 涨到 63.8(+11.3),覆盖从 85 跳到 98.8。在较弱的 GPT-4o 上,Librarian 用覆盖换精度:精度涨、覆盖降,准确率基本持平(35.2 到 35.3),作用是校准而非涨分,让模型在证据不足时弃答而不是瞎猜。但两个模型都还远低于人类专家(宏平均 73.2)。

为什么重要

对从业者有两层价值。一是 Librarian 是一个即插即用、可复用的文献检索层:同一个层在四类任务上都有效,说明「找证据」可以做成所有 agent 共享的公共组件,而不是每个 agent 各自造一遍。二是它用实例佐证了一个更广的趋势:在足够强的 LLM 驱动下,结构化的词法检索(BM25 加字段化查询)可以在科学任务上追平稠密向量检索,而基础设施成本小得多,不用维护几百 GB 的嵌入库。这对任何「该不该为 agent 建专属向量库」的团队都是个值得复算的取舍。

要看到一点:部分对比把检索器和模型规模搅在了一起。Librarian 的综述 agent 用的是约 7000 亿参数的 GLM-5,而已发表基线是 700 亿级,作者自己承认这放大了一部分差距。最干净的检索器隔离对比是 ProClaim 和 LitQA2 两组,那里骨干模型不变,涨幅是 +5 和 +8.6。

局限与存疑

作者自述三条。一是覆盖受 Europe PMC 限制,部分付费墙论文的全文拿不到,计划接入 OpenTargets、UniProt、ChEMBL 等其他生物学知识源。二是不直接做多跳推理,只做一轮检索(靠多条互补子查询补召回),多跳留给下游 agent,未来打算让系统自己判断要不要再搜一轮。三是忽略图表和补充材料,表格也只当文本处理,多模态是后续工作。

读下来还有两点值得拎出来。一是 Librarian 只在「靠文献」的任务上有效:LAB-Bench 里像数据库直查(DbQA)那类题,检索几乎帮不上忙,接上文献反而让两个模型准确率各掉一点。二是这套系统目前强绑定 Europe PMC 的字段化能力,换到一个没有结构化字段的数据源上,「不建索引直接查」的优势就立不住。

术语

原文与代码

相关论文

全部论文解读