零源幻觉检测新方法 HCPD:AUROC 提升 10 个百分点
量子位 · wechat · 2026-08-29
发表于 ICML 2026 的论文《Zero-source LLM Hallucination Detection with Human-like Criteria Probing》研究最严格的零源设定:检测器无法访问目标模型的概率、内部状态,也没有知识库或参考答案,只能依据问答文本本身判断可靠性。
方法 HCPD 模仿人类专家的动态评估过程:预定义事实正确性、逻辑一致性等通用维度后,Agent 针对具体问答自适应生成细粒度评价准则与权重并逐维评分,同时输出可解释的判断依据。训练阶段用 GRPO 做奖励对齐,以语义相似度构造 1-10 分的弱监督标签;推理阶段并行采样多次评估并聚合以降低随机波动。
实验覆盖 TriviaQA、SciQ、NQ-Open、CoQA 四个数据集和 LLaMA、Qwen 两大家族 7 个模型:LLaMA-3.1-8B 上平均 AUROC 达 88.19%,较次优方法提升 10.20%;Qwen-3-8B 上达 89.62%,提升约 10.15%。由于不依赖特定模型内部信号,跨目标模型迁移时检测能力保持稳定。
「研究」频道最新
- 神经网络基础:使用 PyTorch 与 TF 进行图像分类 — Al_Grigor · 2026-08-29
- 决策树与集成学习:XGBoost 模型调优指南 — Al_Grigor · 2026-08-29
- MIRIAD 评测复现:混合检索精度达 0.8476 — philipvollet · 2026-08-29
- Proteus 开源:Agent 可自主改写源代码的自进化框架 — aigclink · 2026-08-29
- 清华姚班新班主任徐梦迪:只靠 Scaling 无法构建通用机器人 — 量子位 · 2026-08-29
- 训练仅奖励结果或导致模型忽视推理过程正确性 — A_K_Nain · 2026-08-29