检索式医学事实核查为何失败?新研究给出两套失败分类法
jhu-clsp · hf · 2026-10-06
针对开放式医学答案的检索式事实核查(RAG 幻觉检测主流范式),研究构建了两套失败分类法:检索阶段错误按五个质量维度分解,验证器推理错误分解为六个连续步骤;并用 LLM-as-Judge 自动标注,在 4 种检索方法与 6 个前沿验证模型上压力测试。
核心发现:
- 扩大模型规模、增加推理算力、扩展权威网页来源、医学微调都无法解决这些失败模式
- 表明它们是「先检索后验证」范式在开放式医学场景的根本局限,而非系统过时的产物
- 代码与数据已开源以便复现
「研究」频道最新
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess免训练缓解全模态幻觉,附3,540例新基准 — Huiqiang Rong · 2026-10-06
- ADSD框架让AI自诊数值求解器,误差降低近71倍 — Peter Chen · 2026-10-06
- ACG-Bench测双臂VLA组合泛化,AE-VLA把成功率从3%拉到21.5% — Zaibin Zhang · 2026-10-06