RLVR + 数据清洗:Text-to-SQL 达人类水平
ddkang · x · 2026-08-28
论文提出通过 RLVR (Reinforcement Learning on Verified Data) 在干净数据上微调 Qwen3-235B,无需复杂工程即可达到人类水平的 Text-to-SQL 性能。
主要发现:
- 现有训练数据存在普遍标注错误,误导模型优化。
- 构建了专家多轮验证管道,从 BIRD Train 中清洗出 BIRD-Platinum 数据集(2.5k 实例,修正了 61% 的错误)。
- 在 BIRD-Platinum 上微调 Qwen3-235B,相比基线在 Arcwise-Plat 和 Spider2 上提升 11-16%,超越 SOTA 开源系统。
「研究」频道最新
- OpenResearch 推出 AutoResearch:用 Agent 复现与自动化实验 arXiv 论文 — simonguozirui · 2026-08-28
- BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二 — himanshustwts · 2026-08-28
- Science 刊文:AI 方法已能自动设计 RNA 治疗药物结构 — rishabh16_ · 2026-08-28
- 自动科研是科学终极形态,RL 探索新行为效率高 5 倍 — const_reborn · 2026-08-28
- Intrinsic Discovery 方法让模型无监督探索环境 — burny_tech · 2026-08-28
- 主动学习筛250万分子,找到阻断RAS驱动癌症新路径 — bravo_abad · 2026-08-28