法律检索的数据泄漏盲区:LegalPincite 做了带段落级精准引用的干净基准

LegalPincite: Multi-level Legal Information Retrieval Dataset

Theresia Veronika Rampisela, Henrik Palmer Olsen, Giovanni Colavizza

cs.IR

2026-08-04

现有法律检索数据集要么没有段落级引用标注,要么查询文本泄漏了答案、还把无关段落剔除让任务失真。LegalPincite 用欧盟法院判例建库,给查询脱敏、保留全部段落,支持案件到案件、段落到案件、段落到段落三级检索。

这篇在解决什么

法律检索的核心动作是找先例:给一段正在写的判决,找出该引用哪些过往判例。实务里律师要的常常是「那个案子的哪一段」,这种段落级精准引用叫 pincite。但已有的公开法律检索数据集有两类问题。大多数只做到案件级或段落到案件级,做不了 pincite;少数几个能做段落级的(都来自欧盟法院 CJEU 判例)又脏:查询段落里直接带着被引用的案件号、段落号,等于把答案写在题目里(数据泄漏),而且语料只收「引用过或被引用过」的段落,把既不引用也不被引用的大多数段落扔了,候选池被人为缩小,检索显得比真实情况容易。

方法

LegalPincite 整合并修复两份既有 CJEU 数据,再补 2021 到 2025 的判例,做法是工程性的清洗加脱敏。

数据集做成兼容 pyterrier 的 CSV,支持三种检索层级。

结果

论文只跑了四个词袋基线(TF-IDF、BM25、LMIR、DPH);作者明说算力不够、法律文本又长,跑不动 dense retriever。测试集上按检索层级看:

检索层级表现最好的基线NDCG@10
案件到案件LMIR0.442
段落到案件TF-IDF0.555
段落到段落BM25(与 TF-IDF 接近)0.528

脱敏的消融最有说服力:把查询里全部引用信息抹掉后,段落到段落检索的 NDCG@10 反而最高,比带泄漏的原始查询高 34.7%,说明泄漏信息在查询里其实是噪声;但只去掉段落号是不够的(案件级仍能虚高 35.6% 到 55%),所以作者建议直接用脱敏后的查询。BM25 在长法律文档上不稳定,因为它对超长文档过罚,这跟既往发现一致。

为什么重要

对做 RAG、法律 NLP、长文档检索的人,这是一个干净的、不泄漏的、带段落级标注的基准,能真实反映检索难度。实务价值在于 pincite:法律文书动辄几百段,律师要的常常是某一段,能做段落级检索的系统比只给案件级的实用得多。它也顺带量化了一个容易被忽视的问题:很多既有检索高分是被泄漏的查询撑起来的,抹掉答案后真实难度才显出来。

局限与存疑

作者自己列了几条:真值引用大多来自 EUR-Lex,存在反馈环,法官可能就是用检索系统找到了这些引用,所以「被引用」未必等于「最相关」;专家标注只针对单个 dense retriever 的 top-10 结果,不穷尽,因此评估应侧重短截断的精确率指标而非召回;自动脱敏 pipeline 有人工抽查发现的漏网,系统审计留作未来工作。还有一点要补充:只跑了四个词袋基线、没有 dense retriever,这个基准的「天花板」还没被探到,数字只能说明词袋方法的相对强弱,不代表现代检索器在这上面的真实水平。

术语

原文与代码

相关论文

全部论文解读