4B Qwen 经 SFT+RL 优化查询计划:Join Order Benchmark 提速 81%,成本仅 1200 美元
JeremyCMorgan · x · 2026-09-22
Rohan Bansal 用 4B 参数的 Qwen 模型,经 SFT + agentic RL 后训练,通过 pghintplan 输出 Postgres 查询提示,在 Join Order Benchmark 上取得 1.81 倍 geomean 提速,总成本约 1200 美元,代码已开源。
关键设计:
- 问题选择:join ordering 是 NP-hard,Postgres 优化器十年来仍有明显缺陷;而查询计划好坏极易验证(只看执行时间),是 RL 的理想奖励信号;
- agentic RL 流程:每次 rollout 让 Qwen 生成候选策略,发给 Postgres 实测与其默认计划对比,按执行时间赋标量奖励回传更新权重;
- 测量环境坑:将 sharedbuffers 提到 2GB 后,幻影奖励(噪声)降低约 4 倍,是实验可复现性的关键。
小模型+可验证奖励,在传统系统优化任务上击败了内置优化器。
「编程与Agent」频道最新
- 开源 Landing Page 设计 Skill:为 Claude Code 定制整套视觉系统 — GCWebDesigner · 2026-09-22
- Doe v. GitHub 案作出重要裁决,Copilot 输出侵权主张迎关键进展 — technollama · 2026-09-22
- claude-uds-bridge:让 Codex 和 Claude 原生互发消息 — LeonKohli · 2026-09-22
- shadcn+Mobbin MCP 组合,1-2 秒生成完整响应式界面 — msharmas · 2026-09-22
- Nat Friedman 承认 Muse 灵感来自 OpenClaw,曾买数百台 Mac mini — EdwardSun0909 · 2026-09-22
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22