Text-to-SQL 论文指出,标注错误会扭曲排行榜和成绩
ddkang · x · 2026-07-28
- 这条线程来自一篇 text-to-SQL 论文,核心观点是:基准数据的标注质量 对排行榜可靠性至关重要,不能盲信 leaderboard。
- 作者团队通过自动诊断代理加上人类 SQL 专家复核,系统审计了 BIRD Mini-Dev 和 Spider 2.0-Snow 等常用 benchmark。
- 论文指出,标注错误不仅会影响单个样本,还会 实质改变模型/agent 的性能评估与排名。
所属事件:VLDB 2026论文审计发现BIRD与Spider 2.0-Snow错标率超50%(8 条相关)→
「研究」频道最新
- q-Neurons:用随机 q 导数激活函数提升神经网络性能 — FrnkNlsn · 2026-09-23
- 曝 OpenAI 将办期刊:内部模型多 agent 评审,冲击 ML 会议 — kfountou · 2026-09-23
- 耶鲁博士生开源顶会论文画图脚本,还能接入 Claude Code 当 Skill — burny_tech · 2026-09-23
- AI 在 ForecastBench 上追平超级预测员,10 月将再战 — burny_tech · 2026-09-23
- 几句 prompt 让 Opus 用 Lean 形式化验证 Agent SDK,产出 16 个修 bug PR — bcherny · 2026-09-23
- 数学家群体才是 AI 数学突破的幕后功臣 — tak3sh8 · 2026-09-23