SIRIN 统一三派幻觉检测,把服务准确率从62%拉到79%

SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems

Julia Belikova, Rauf Parchiev, Mikhail Filimonov, Konstantin Polev, Andrey Savchenko, Maksim Makarenko

cs.AI

2026-07-20

SIRIN把探针、judge与不确定性三类幻觉检测统一进一个工具箱,接入记忆系统后服务准确率从62%升到79%,不实率减半。

这篇在解决什么

检索增强、agentic、长期记忆型 LLM 系统都有同一个毛病:模型会给出流畅但脱离证据的答案,这类错误叫上下文幻觉(contextual hallucination)。检测它的方法分成三派——探针(probing)在模型隐藏状态上训练分类器,判官(judge)用另一个模型做事实核查,不确定性估计(uncertainty estimation)看模型自己对生成结果的置信度。问题是这三派各自为战:LM-Polygraph 只做不确定性、RAGAS 和 DeepEval 只做判官式核查、LettuceDetect 能定位到 token 级别但只有一种检测器。想在同一套流程里比较三派、混用信号,此前没有现成工具,只能各写一遍。

方法

SIRIN 把三派检测器和一个前置任务(生成前判断上下文是否够用来回答,即 query answerability)收进同一个接口、同一套配置系统、同一条评测流水线。核心抽象是统一的检测报告格式:每个检测器输入 (context, query, answer) 三元组,输出一个校准过的分数、预测标签,外加可选的证据(不支持的 span、不确定性值、judge 给出的理由)。后端可插拔:Transformers 拿白盒内部状态,vLLM 做高吞吐生成和 log-prob 打分,OpenAI 兼容接口接黑盒 judge。composing processor 会在一次前向传播里把多种信号(探针特征、attention 模式、不确定性分数)一次性抽出来,让多信号探针的成本接近单信号。配套的 Streamlit 网页界面可以粘贴一个 context-query-answer 三元组,选检测器组合,实时看到幻觉分数、不支持片段高亮和多个检测器的并排对比。

结果

在 RAGTruth 的三个子集(QA、摘要、data-to-text)上,标注充足时 LoRA 微调过的 Qwen3-4B judge 最强,AUROC 达到 91.893.5,比同任务最好的探针高 5.59.0 点;零样本的 GPT-5.4-mini judge 紧随其后(82.088.8 AUROC)。反过来,在 SQuAD 2.0 这种标注稀缺的场景,轻量级 attention-pooling 探针只比 LoRA judge 低几个点(78.4 vs 87.0 AUROC),说明探针在标注不够时性价比更高。span 级定位上同样是判官领先(PsiloQA 上 74.8 F1、69.3 IoU),零样本 span 标注则直接崩溃。最能说明问题的实验是把 SIRIN 接到 SimpleMem 长期记忆系统上做选择性预测:同时挂上「能不能回答」的前置门和「答案是否忠实」的后置门,LongMemEval 上的服务准确率从未设防的 62.4% 升到 79.3%,严格意义上的不实回答率从 20.2% 砍到 9.8%,而且这个提升在换成 Mem0(+13.2 点)和 LightMem(+14.3 点)两个不同记忆框架时依然成立。

为什么重要

这不是一个新的检测算法,是一层可以直接接进现有 RAG/agent 记忆管线的信任层,不用改应用代码,在检索阶段插两个门(生成前判断证据够不够,生成后判断答案有没有编)。对已经在用 RAG 或长期记忆 agent 的团队,SIRIN 提供的价值主要是省掉了自己拼三套检测框架的工程量,以及一套标准化的报告格式方便切换检测器。标注多的时候上 judge,标注少或要省算力时上探针,是这篇论文给出的一条明确的选型经验。

局限与存疑

论文承认探针和 judge 都只在英文数据上训练和验证,换语言基本要重新标注和微调。记忆系统的实验只用了一个生成器骨干(Qwen3.5-35B-A3B)配 attention-pooling 探针和 GPT-5.4-mini judge,门是否能在完全不同的骨干模型上直接复用还没测过。网页界面同时保温的模型配置数量也被 GPU 显存限制在 68 个,想同时对比更多检测器组合需要额外硬件。另外两个记忆框架的选择性预测结果(Mem0、LightMem)用的是修订过的重新标注协议,和主表(SimpleMem)不是完全同一套评测口径,横向比较时要小心。

术语

原文与代码

社区讨论

相关论文

全部论文解读