VLDB 2026论文审计发现BIRD与Spider 2.0-Snow错标率超50%
一篇VLDB 2026论文对主流text-to-SQL基准进行了系统审计,发现BIRD Mini-Dev与Spider 2.0-Snow的标注错误率分别高达52.8%和62.8%。研究表明,基准数据的标注质量对排行榜的可靠性至关重要,当前大模型的现有成绩与排名已被严重扭曲,呼吁开发者核查数据本身,不要盲信排名。
已确认
研究团队采用三阶段审计流程:首先使用自动诊断系统SAR-Agent为每个样本生成诊断报告;随后由人类SQL专家逐条裁定被标记的案例;最后针对具有重复错误模式的样本进行回看复核。
在错误类型分布上,因“对数据理解不足”导致的错标最为常见,在BIRD Mini-Dev与Spider 2.0-Snow中分别占57.79%和57.89%。
在修正后的BIRD Dev子集上对16个开源text-to-SQL agent重新评估后,排名出现了-9到+9的剧烈波动。例如,原本的SOTA模型Contextual-SQL从第1名跌落。
为什么重要
当前大模型在text-to-SQL任务上的评估高度依赖这些主流基准与排行榜。超过半数的标注错误意味着学术界和工业界在评估agent性能时,必须将数据集本身的质量审查置于排名之前,否则会得出误导性的结论。
2026-07-28 ~ 2026-07-28 · 8 条相关
一手来源
- VLDB 2026 论文发现,BIRD 和 Spider 2.0-Snow 错标率超 50% — ddkang ·
- 两个常用 text-to-SQL 基准被审出 52.8% 和 62.8% 错标率 — ddkang ·
- 修正后 text-to-SQL 数据让 16 个开源 agent 排名最多变 9 位 — ddkang ·
- 研究发现 BIRD 与 Spider 2.0-Snow 标注错误率超五成 — ddkang · 2026-07-28
- Text-to-SQL 基准审计采用 SAR-Agent 与专家复核 — ddkang · 2026-07-28
- 【源头】VLDB 2026 论文发现,BIRD 和 Spider 2.0-Snow 错标率超 50% — ddkang · 2026-07-28
- 【源头】两个常用 text-to-SQL 基准被审出 52.8% 和 62.8% 错标率 — ddkang · 2026-07-28
- 【源头】修正后 text-to-SQL 数据让 16 个开源 agent 排名最多变 9 位 — ddkang · 2026-07-28
- Text-to-SQL 基准审计发现,最常见错标是数据理解不足 — ddkang · 2026-07-28
- 论文提醒:text-to-SQL 基准先查数据质量,别先信排名 — ddkang · 2026-07-28
- Text-to-SQL 论文指出,标注错误会扭曲排行榜和成绩 — ddkang · 2026-07-28