训练进执行 harness,Qwen3-14B 在 Spider 2.0 从 22.2% 飙到 54.8%
omarsar0 · x · 2026-10-11
论文 HarnessSQL 显示,把模型放进部署时使用的同一执行 harness 里训练,成绩可以翻倍以上:Qwen3-14B 在 Spider 2.0-SQLite 上从 22.2% 提升到 54.8%,Qwen3-8B 从 15.5% 提升到 45.2%,且两者都能迁移到 BIRD-Interact 和 LiveSQLBench。
方法要点:
- 传统 text-to-SQL 只训练模型写一条静态查询,而部署时的数据库 agent 会检查 schema、跑探测查询并迭代修改——这种 harness 通常只在推理时出现
- HarnessSQL 构建带隐藏答案校验的隔离可执行数据库,教师模型在目标 harness 内运行,只保留验证通过的轨迹做 SFT,再用执行奖励做 RL
结论:训练 harness 与部署 harness 的一致性是 agent 性能的关键变量。
「编程与Agent」频道最新
- Grok Bot 可接管 X 账号干活,作者给出 10 个可直接复制的定时任务 — dr_cintas · 2026-10-11
- 同时跑 16 个 Cursor 项目,最高频 prompt 变成「/bro 给我同步下进度」 — RachelVT42 · 2026-10-11
- 多智能体上生产的真实形态:哪些架构能用,哪些被放弃 — fkj83 · 2026-10-11
- 开源 MCP 服务器让 Claude Opus 5.5 端到端写出 2 分钟完整音轨 — delarein · 2026-10-11
- 免费版 Photoshop 网上流出,内嵌 AI Agent 控制端口 — aakashgupta · 2026-10-11
- 用 Claude+Codex 搭「设计实验室」,跨项目集中管理设计迭代 — RileyRalmuto · 2026-10-11