VLDB论文揭示两大Text-to-SQL基准错标率超50%

一篇 VLDB 2026 论文对主流 text-to-SQL 基准进行了系统审计,发现 BIRD Mini-Dev 与 Spider 2.0-Snow 的标注错误率分别高达 52.8% 和 62.8%。研究指出,基准数据的标注质量对排行榜的可靠性至关重要,呼吁开发者核查数据本身,不要盲信排名。

已确认

研究团队采用三阶段审计流程:首先使用自动诊断系统 SAR-Agent 为每个样本生成诊断报告;随后由人类 SQL 专家逐条裁定被标记的案例;最后针对具有重复错误模式的样本进行回看复核。在错误类型分布上,因“对数据理解不足”导致的错标最为常见,在 BIRD Mini-Dev 与 Spider 2.0-Snow 中分别占 57.79% 和 57.89%。

为什么重要

当前大模型在 text-to-SQL 任务上的评估高度依赖这些主流基准与排行榜。超过半数的标注错误意味着现有的模型成绩与排名可能被严重扭曲,这促使学术界和工业界在评估 agent 性能时,必须将数据集本身的质量审查置于排名之前。

2026-07-28 ~ 2026-07-28 · 7 条相关

一手来源