4B 模型 RL 训练后查询计划比 Postgres 默认快 81%
bytebot · x · 2026-09-17
开发者 Rohan Bansal 发文介绍一项实验:用 SFT + agentic RL 后训练开源 4B 模型(Qwen),让其生成比 Postgres 默认优化器更快的查询计划,实测最高快 81%。
- 问题背景:Leis 等人 2015 年与十年后两度研究发现,查询优化器(尤其是 join ordering,已知 NP-hard)表现持续不理想。
- 为何适合 RL:查询计划好坏有单一可验证信号——执行时间,正是语言模型擅长学习的可验证奖励任务。
- 训练方法:每个 query 跑 4 个 RL rollout,Qwen 产出候选计划交 Postgres 实测,与默认计划对比后给标量奖励,梯度回传更新权重。
- 结论:小模型经 agentic RL 后训练可以打赢数据库内置优化器。
「编程与Agent」频道最新
- 数据分级即路由:Agent 时代按标签决定数据能喂哪个模型 — blaizedsouza · 2026-09-17
- 当 RAG 检索到投毒文档,Agent 会照做吗?团队将其做成可复用安全测试 — Tophant_ · 2026-09-17
- Agent 替员工「翻译」需求而非填表单:广播媒体客户的自动化实践与两难 — NumbersProtocol · 2026-09-17
- 开发者自造 GitHub Radar:一个跨仓库跨组织的追踪 UI — dSebastien · 2026-09-17
- 99 行 C++ 写出物理光线追踪器 smallpt,含反射折射软阴影 — blaizedsouza · 2026-09-17
- 非工程师一个上午搭好视频剪辑流水线:Dify + Gemini + Agent 组合实战 — Individual_Reality_6 · 2026-09-17