两个常用 text-to-SQL 基准被审出 52.8% 和 62.8% 错标率
ddkang · x · 2026-07-28
- 这条内容给出论文的关键数字:BIRD Mini-Dev 与 Spider 2.0-Snow 的标注错误率分别达到 52.8% 和 62.8%。
- 研究团队采用了三步审计流程:先用自动诊断系统生成逐样本报告,再由 SQL 专家裁定被标记样本,最后对重复出现的错误模式做额外复核。
- 作者认为,这些问题会误导研究路线,也可能影响真实部署时的模型选择。
所属事件:VLDB 2026论文审计发现BIRD与Spider 2.0-Snow错标率超50%(8 条相关)→
「研究」频道最新
- Agent 架构法则:验证器可参与生成反馈,但不得直接晋升候选解 — blaizedsouza · 2026-09-23
- q-Neurons:用随机 q 导数激活函数提升神经网络性能 — FrnkNlsn · 2026-09-23
- 曝 OpenAI 将办期刊:内部模型多 agent 评审,冲击 ML 会议 — kfountou · 2026-09-23
- 耶鲁博士生开源顶会论文画图脚本,还能接入 Claude Code 当 Skill — burny_tech · 2026-09-23
- AI 在 ForecastBench 上追平超级预测员,10 月将再战 — burny_tech · 2026-09-23
- 几句 prompt 让 Opus 用 Lean 形式化验证 Agent SDK,产出 16 个修 bug PR — bcherny · 2026-09-23