Q-CARE 免标准答案评测 RAG,八个数据集上与人工判断最一致

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

COLM 2026

cs.AI

2026-07-31

Q-CARE 把查询与答案拆解,从覆盖度与可验证性两个维度无标准答案地评测 RAG,在八个数据集上与人工判断的相关性最高。

这篇在解决什么

RAG 系统的失败可能出在检索、生成或两者衔接处,评测因此难做。现有的评测框架在一个结构性权衡里打转:RAGChecker、RAGEval 这类能做到断言级(claim-level)细粒度诊断,但依赖标准答案或人工标注的相关片段,只能服务「封闭式」查询(有唯一确定答案的那种);ARES、RAGAs、DoRAG 这类免标准答案,能撑开放式查询,但粒度粗得多。结果是没有任何方法能同时做到细粒度、免标准答案、又能同时覆盖封闭与开放两类查询。

更根本的问题在于:现有方法把「正确」当成一个个孤立检查(这个片段相不相关、这条断言对不对得上标准答案),却不问「查询的本意被满足了吗」,而这个问题与查询类型无关。

方法

Q-CARE(COLM 2026,KAIST)把「答案正确」重新定义成两个对任何查询都成立的判据:覆盖(答案回应了查询隐含的所有信息需求)和可验证(答案里每一句话都能被检索到的证据支撑)。这两个信号把任何查询翻译成同一种度量,从而做到 query-agnostic(与查询类型无关)。

具体分三步:

结果

Q-CARE 自建了一个跨八个数据集、含人工标注的 benchmark,567 个子问题、7907 条断言,标注者间 Fleiss' kappa 0.80 到 0.89。在与人工判断的 Pearson 相关性上:

维度(开放式查询)Q-CARE最强基线(RAGChecker)
完整性0.470.17
可验证性0.690.56

Q-CARE 在所有维度、两类查询上相关性都最高,而 RAGAs、RAGChecker 从封闭式挪到开放式时相关性明显下滑。检索排名上的对比更说明问题:用传统 Precision@k 给 21 个检索器排名,跨查询类型的排名一致性(Spearman)只有 0.55,换成覆盖感知的 C-Prec@k 升到 0.89。不显式建模查询覆盖时,系统级排名可能整篇误导。

Q-CARE 不显著增加延迟,封闭式每查询约 55 秒、开放式约 98 秒,远快于 DoRAG 的 390 到 466 秒。换更大的 backbone(如 Llama-3.3-70B)相关性更高,但 8B 的小模型在开放式查询上相关性很弱。

为什么重要

对做 RAG 评测和选型的人,这是少数能同时诊断「检索够不够」和「答得准不准」、又不需要攒标准答案的框架。免标准答案这一点对开放式、长答案场景尤其值钱,那种场景下攒标准答案本身就不现实。它还能直接告诉你失败出在检索还是生成,而不是只给一个总分。

局限与存疑

整个框架的上限被充当裁判的 LLM 卡住:8B 模型在开放式查询上几乎不可用,说明它只在有足够强的 backbone 时才可靠。每查询几十次 LLM 调用带来 55 到 98 秒延迟,虽然能并行化,但离廉价还远。论文自承二值(是/否)对齐在开放式查询上反而比三档打分更准,意味着「细粒度」未必总是更好。另外,与人工做相关性的查询只有 320 条,样本不算大。

术语

原文与代码

社区讨论

相关论文

全部论文解读