VLDB论文揭示两大Text-to-SQL基准错标率超50%
一篇 VLDB 2026 论文对主流 text-to-SQL 基准进行了系统审计,发现 BIRD Mini-Dev 与 Spider 2.0-Snow 的标注错误率分别高达 52.8% 和 62.8%。研究指出,基准数据的标注质量对排行榜的可靠性至关重要,呼吁开发者核查数据本身,不要盲信排名。
已确认
研究团队采用三阶段审计流程:首先使用自动诊断系统 SAR-Agent 为每个样本生成诊断报告;随后由人类 SQL 专家逐条裁定被标记的案例;最后针对具有重复错误模式的样本进行回看复核。在错误类型分布上,因“对数据理解不足”导致的错标最为常见,在 BIRD Mini-Dev 与 Spider 2.0-Snow 中分别占 57.79% 和 57.89%。
为什么重要
当前大模型在 text-to-SQL 任务上的评估高度依赖这些主流基准与排行榜。超过半数的标注错误意味着现有的模型成绩与排名可能被严重扭曲,这促使学术界和工业界在评估 agent 性能时,必须将数据集本身的质量审查置于排名之前。
2026-07-28 ~ 2026-07-28 · 7 条相关
一手来源
- 两个常用 text-to-SQL 基准被审出 52.8% 和 62.8% 错标率 — ddkang ·
- Text-to-SQL 基准审计采用 SAR-Agent 与专家复核 — ddkang ·
- Text-to-SQL 基准审计发现,最常见错标是数据理解不足 — ddkang ·
- 研究发现 BIRD 与 Spider 2.0-Snow 标注错误率超五成 — ddkang · 2026-07-28
- 【源头】Text-to-SQL 基准审计采用 SAR-Agent 与专家复核 — ddkang · 2026-07-28
- VLDB 2026 论文发现,BIRD 和 Spider 2.0-Snow 错标率超 50% — ddkang · 2026-07-28
- 【源头】两个常用 text-to-SQL 基准被审出 52.8% 和 62.8% 错标率 — ddkang · 2026-07-28
- 【源头】Text-to-SQL 基准审计发现,最常见错标是数据理解不足 — ddkang · 2026-07-28
- 论文提醒:text-to-SQL 基准先查数据质量,别先信排名 — ddkang · 2026-07-28
- Text-to-SQL 论文指出,标注错误会扭曲排行榜和成绩 — ddkang · 2026-07-28