Text-to-SQL 论文指出,标注错误会扭曲排行榜和成绩
ddkang · x · 2026-07-28
- 这条线程来自一篇 text-to-SQL 论文,核心观点是:基准数据的标注质量 对排行榜可靠性至关重要,不能盲信 leaderboard。
- 作者团队通过自动诊断代理加上人类 SQL 专家复核,系统审计了 BIRD Mini-Dev 和 Spider 2.0-Snow 等常用 benchmark。
- 论文指出,标注错误不仅会影响单个样本,还会 实质改变模型/agent 的性能评估与排名。
所属事件:VLDB论文揭示两大Text-to-SQL基准错标率超50%(7 条相关)→
「研究」频道最新
- Kimi K3 报告披露内核优化、编译器和芯片原型 — stochasticchasm · 2026-07-28
- 人工生命视频补充了 Lenia 模拟器链接 — max_romana · 2026-07-28
- 人工生命视频追问:开放式进化还缺什么 — max_romana · 2026-07-28
- Macrocosmos 启动三大洲分布式的 160 亿参数训练 — markjeffrey · 2026-07-28
- 一份免费 AI 课程地图:从基础到 LLM 的学习路径 — tetsuoai · 2026-07-28
- Kimi 报告披露覆盖编程与 Agent 的内部评测体系 — stochasticchasm · 2026-07-28