研究发现 BIRD 与 Spider 2.0-Snow 标注错误率超五成
ddkang · x · 2026-07-28
核心结论
作者在这篇 VLDB 2026 论文里指出,两个常用的 text-to-SQL 基准 BIRD 和 Spider 2.0-Snow 存在普遍标注错误。经专家审查后,他们报告两者的错误率都超过 50%,并且这些错误会让 agent 的测得性能最多偏移 19%。
影响
论文的核心意思是:text-to-SQL 的公开榜单未必像看上去那样可靠,因为标注质量本身已经足以显著改变评测结果和排名。
所属事件:VLDB论文揭示两大Text-to-SQL基准错标率超50%(7 条相关)→
「编程与Agent」频道最新
- 一篇指南称,大多数代码库还没准备好云端编程智能体 — vinvan · 2026-07-28
- 梗图调侃:是现在写代码,还是等模型一把写完 — Darpinian · 2026-07-28
- UWaterloo 开源可审计的实时训练控制平面 — UWaterloo · 2026-07-28
- LangChain 展示 dcode:10 秒内把 GPT-5.6 切到 Kimi K3 — LangChain · 2026-07-28
- Waddle Labs 推出机器人版 Claude Code,称 20 分钟可完成任务 — ycombinator · 2026-07-28
- 团队找出同一系统提示词的四个副本,线上还在用第五份 — larabyeol · 2026-07-28