NeurIPS 医疗评测论文入选 Oral:检索式事实核查的系统性失败图谱

mdredze · x · 2026-10-09

约翰霍普金斯 Mark Dredze 团队的论文《Where Does Retrieval-Based Open-Ended Evaluation Fail?》入选 NeurIPS GenAI4Health Oral(约 250 篇投稿中的前 4%),第一作者 Heyuan Huang。同时团队在 DEX26 获最佳摘要(观众选择奖):LLM 能查出大量医生诊断错误,但差距仍很大。

论文针对医疗领域主流的「检索后验证」幻觉检测范式:现有系统只看 F1 等聚合指标,掩盖了失败发生在哪里、为什么。研究基于开放式 MedExpert 数据集及 3 个封闭数据集,构建了两套失败分类体系——检索阶段沿 5 个质量维度的错误,和验证器推理 6 个连续步骤的错误;用 LLM-as-Judge 自动标注证据质量并规模化分类验证错误,随后在 4 种检索方法和 6 个前沿验证模型上做压力测试。

关键发现:放大模型规模、增加推理算力、换用权威网络来源、医疗领域微调,都无法修复这些系统性失败。

所属事件:研究称医疗AI事实核查系统性失败,大模型与微调均无解(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →