GEPA 用自然语言反思在 LLM 调优中跑赢 GRPO
gajesh · x · 2026-07-27
GEPA(Genetic-Pareto) 是一种用自然语言反思来搜索更优提示词的 prompt optimizer,论文声称它在某些 LLM 适配任务上甚至能优于强化学习方法。
核心思路
- GEPA 不依赖标量 reward 的梯度,而是从包含推理、工具调用和工具输出的系统轨迹中采样。
- 它会用自然语言反思这些轨迹,诊断问题、提出 prompt 修改,并从多次尝试的 Pareto 前沿里组合有效经验。
- 这样做的好处是:prompt 优化更可解释,也更省样本。
结果
- 论文被 ICLR 2026 Oral 接收。
- 在 6 个任务上,GEPA 平均比 GRPO 高 6%,最高可高 20%。
- 只用 5 次 rollouts,它就能超过更强的基线。
- 在文中报告的基准上,它也比领先的 prompt optimizer MIPROv2 高 10%+。
- 作者还称其在 AIME-2025 上拿到 +12% accuracy,并且很适合作为代码优化的推理时搜索策略。
- 代码已开源:github.com/gepa-ai/gepa。
「研究」频道最新
- AgentPrune 让多智能体通信成本从 43.7 美元降到 5.6 美元 — sebkrier · 2026-07-27
- 一种新因果建模图把排序、上下文和邻接都纳入结构 — KordingLab · 2026-07-27
- WMO 推出模型路由器,称可把 agent 成本降 40%+ — SilenN · 2026-07-27
- 前沿 LLM 能多找十倍问题,但评审不是拼找茬数量 — gleech · 2026-07-27
- COLM 2026 论文可走可行动解释性工作坊快通道 — sarahwiegreffe · 2026-07-27
- 推理研究最大变化:从符号轨迹走向自然语言 — denny_zhou · 2026-07-27