NeurIPS 医疗评测论文入选 Oral:检索式事实核查的系统性失败图谱
mdredze · x · 2026-10-09
约翰霍普金斯 Mark Dredze 团队的论文《Where Does Retrieval-Based Open-Ended Evaluation Fail?》入选 NeurIPS GenAI4Health Oral(约 250 篇投稿中的前 4%),第一作者 Heyuan Huang。同时团队在 DEX26 获最佳摘要(观众选择奖):LLM 能查出大量医生诊断错误,但差距仍很大。
论文针对医疗领域主流的「检索后验证」幻觉检测范式:现有系统只看 F1 等聚合指标,掩盖了失败发生在哪里、为什么。研究基于开放式 MedExpert 数据集及 3 个封闭数据集,构建了两套失败分类体系——检索阶段沿 5 个质量维度的错误,和验证器推理 6 个连续步骤的错误;用 LLM-as-Judge 自动标注证据质量并规模化分类验证错误,随后在 4 种检索方法和 6 个前沿验证模型上做压力测试。
关键发现:放大模型规模、增加推理算力、换用权威网络来源、医疗领域微调,都无法修复这些系统性失败。
所属事件:研究称医疗AI事实核查系统性失败,大模型与微调均无解(3 条相关)→
「研究」频道最新
- Meta 发布 RoboJEPA:8B 参数机器人世界模型,首提多具身 scaling law — meta · 2026-10-09
- Inherit-MAS:借鉴生物遗传的多智能体系统测试时进化,省 34.6% token — Songtao Wei · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09