修正后 text-to-SQL 数据让 16 个开源 agent 排名最多变 9 位
ddkang · x · 2026-07-28
- 在修正后的 BIRD Dev 子集上重新评估 16 个开源 text-to-SQL agents 后,排名波动达到 -9 到 +9。
- 原本的 SOTA Contextual-SQL 从第 1 掉到第 7,而 GenaSQL 和 CHESS 则升到第 1。
- 配图对比了原始与修正后的执行准确率,说明 leaderboard 对标注质量极其敏感。
「研究」频道最新
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- K3 论文揭示推理层级自学习、rollout 卡顿与自增长知识图谱 — tokenbender · 2026-07-28
- Moonshot 称 Kimi K2.5 用 15.5T token 训练 1 万亿参数 — CatAstro_Piyush · 2026-07-28
- 10 万开发者研究显示,AI 编码增益到发版只剩约 30% — amcafee · 2026-07-28
- Moonshot 的 Mooncake 服务架构让长上下文吞吐最高提升 525% — stochasticchasm · 2026-07-28
- AI 与程序员生产率论文:人机更像强互补 — mattbeane · 2026-07-28