VLDB 2026论文审计发现BIRD与Spider 2.0-Snow错标率超50%

一篇VLDB 2026论文对主流text-to-SQL基准进行了系统审计,发现BIRD Mini-Dev与Spider 2.0-Snow的标注错误率分别高达52.8%和62.8%。研究表明,基准数据的标注质量对排行榜的可靠性至关重要,当前大模型的现有成绩与排名已被严重扭曲,呼吁开发者核查数据本身,不要盲信排名。

已确认

研究团队采用三阶段审计流程:首先使用自动诊断系统SAR-Agent为每个样本生成诊断报告;随后由人类SQL专家逐条裁定被标记的案例;最后针对具有重复错误模式的样本进行回看复核。

在错误类型分布上,因“对数据理解不足”导致的错标最为常见,在BIRD Mini-Dev与Spider 2.0-Snow中分别占57.79%和57.89%。

在修正后的BIRD Dev子集上对16个开源text-to-SQL agent重新评估后,排名出现了-9到+9的剧烈波动。例如,原本的SOTA模型Contextual-SQL从第1名跌落。

为什么重要

当前大模型在text-to-SQL任务上的评估高度依赖这些主流基准与排行榜。超过半数的标注错误意味着学术界和工业界在评估agent性能时,必须将数据集本身的质量审查置于排名之前,否则会得出误导性的结论。

2026-07-28 ~ 2026-07-28 · 8 条相关

一手来源