GPT-5.4 深度推理仍漏掉 40% 的张冠李戴法律引用,Bloomberg 测了 14 个模型配置

Is this Citation on Point?

Apurv Verma

ICML 2026

cs.DL, cs.CL

2026-08-13

把真实判决里的引用页码换掉再让模型核查,GPT-5.4 深度推理在判决书上仍漏掉 40% 的张冠李戴引用,现有模型都把主题相关当成了引用支持。

这篇在解决什么

2023 年 Mata v. Avianca 案里,两名律师因提交含 ChatGPT 编造引用的文书被纽约法官制裁。此后法律 AI 的评测大多盯着「引用的案例不存在」这类幻觉,而数据库一查就能戳穿。更隐蔽的失败是:案例真实存在,页码真实存在,但被引的那一页根本不支持用它论证的观点。这正是律师做 cite-check(引用核对)时最耗人时的部分,也是现有法律 LLM 评测几乎没碰过的盲区。

这篇(ICML 2026,Bloomberg 的 Apurv Verma)构造了一个 proposition-level 引用支持性验证的基准:判断一条引用是否真的支持它所附着的法律命题。

方法

数据来自两个公开语料:CLERC(联邦法院判决书,约 2000 条引用)和 BriefMe(法律简报,约 750 条)。引用按功能分为 substantive(主张法律规则)、procedural(程序历史)、secondary(背景)三类,只评 substantive(占 70% 左右)。

关键设计是对真实引用做受控扰动,构造三档难度:

Hard 档对应真实 cite-check 里最难的部分:发现换了 authority 容易,验证某一页是否支持某个命题难。人工验证显示标注者与启发式标签一致率 84-88%。模型侧拿到的是被引页的全文,判断 on point 或 not on point。共测 14 个模型配置:OpenAI(GPT-4.1/4o/5/5.4,其中 GPT-5.4 含标准与 high reasoning 两档)、Anthropic(Sonnet 4/4.6、Opus 4.6)、Google(Gemini 2.5 Flash/Pro、3.1 Pro)。指标是 corrupted 引用上的 recall 加 valid 引用上的 false positive rate(FPR)。

结果

设置Easy recallHard recallFPR
GPT-5.4(reasoning),CLERC 判决书99.8%59.8%13.1%
GPT-5.4(reasoning),BriefMe 简报99.4%82.0%14.4%
GPT-4o,CLERC(高召回端)99.8%60.6%34.9%
Claude Opus 4.6,CLERC(低误报端)98%+36.5%4.1%
Gemini 2.5 Pro,BriefMe99.1%82.7%16.3%

几个横切结论:

失败模式分析(对模型输出的 rationale 做人工编码)发现三种套路:约三分之二的漏判里,模型编造理由称被引页「明确陈述了」某句实际不存在的话;模型把主题重叠当成支持;模型没去核对逐字引文,在 GPT-5 的假阴性里,被引页上 92% 根本找不到那句引文。

论文还试了 page-grounded prompting(在提示里显式要求先核对逐字引文、再做页级验证、区分主题与支持):GPT-5.4(reasoning)在 CLERC 上 Hard recall 从 59.8% 提到 73.2%,但 FPR 从 13.1% 升到 19.5%;BriefMe 上 GPT-5 从 77.0% 到 91.0%,FPR 从 14.4% 到 22.5%。每个模型都涨召回,也每个模型都涨误报,因为更强的怀疑不加区分地指向所有引用。结论一句话:模型可以被推得更怀疑,但还不能选择性地怀疑。

为什么重要

对法律 AI 从业者,这篇给出了一个可直接对照的自查清单:你的系统若要做引用核查,「案例存在」这层验证远远不够,页级支持性才是真门槛;当前最好的配置(GPT-5.4 high reasoning + page-grounded 提示)在判决书上仍有约 27% 的漏检和近 20% 的误报,离能替代人工 cite-check 还远。对更广的 LLM 从业者,结论可迁移:RAG 与搜索场景里「检索到的文档相关」和「文档支持这个论断」是两种能力,当前模型把两者混为一谈,topic match 不等于 support。评测方法本身也可复用:对真实引用做受控扰动、按难度分档、同时报召回与误报,这套框架适合搬到其他领域(医学指南、财务披露、学术引用)。

局限与存疑

作者自述的:只覆盖美国联邦法院的 substantive 引用;on point 判为二值,而实务中律师还要分 binding/persuasive authority、事实类比程度、判例是否被推翻;扰动可能碰巧仍然 on point,recall 或被低估;没测「区分性引用」「批评性引用」这类关系型错配;没与人工法律审查工作流做端到端成本对比。

读下来另有两点值得留意。其一,人工一致率 84-88% 意味着基准本身带着 12-16% 的标签噪声,CLERC 上模型间几个百分点的差距在这个噪声带附近,排序未必稳。其二,page-grounded 提示是作者自己写的较强基线,「提示工程已到顶」的结论建立在单一提示之上;检索增强或专门训练的 verifier 是否能打破召回-误报的死结,论文没有验证。

术语

原文与代码

相关论文

全部论文解读