COLM 2026 提出 LakeQuest 基准:直击 RAG 系统证据误用痛点

hllo_wrld · x · 2026-08-01

LakeQuest 是一个全新的基准测试,用于评估系统在异构数据湖上的自然语言接地问答能力。它涵盖了机器学习模型卡、零售银行和药物数据三个真实场景,包含经过人工验证的问题,且每个答案都指向支持它的具体表格行或段落。

该基准能帮助开发者明确区分系统是“未能找到证据”还是“找到了证据但未能正确应用”。研究团队发现了一个关键痛点:如今系统通常都能检索到正确的策略或表格,但往往在后续推理中错误应用了这些信息。此外,模型有时会在毫无证据支持的情况下猜中正确答案,这对于需要严格审计追踪的应用场景构成了严重问题。

所属事件:COLM 2026推LakeQuest评估真实数据湖问答(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →