GEPA 反射优化:3 个样本就超越 GRPO 25000 次滚动,ARC-AGI 提到 89.5%

AI Engineer · youtube · 2026-09-27

AI Engineer 频道访谈 GEPA 作者、UC Berkeley Sky Computing Lab 博士生 Lakshya A. Agrawal,讲反射式 prompt 优化为何能大幅超越强化学习。

核心论点:RL 把整条 rollout 压缩成一个分数,丢掉了过程信息;GEPA 则让模型阅读完整轨迹(思维链、工具调用、报错信息)并据此改写 prompt,用 Pareto 候选池避免陷入局部最优。仅对 3 个例子做一轮反射,增益就是 GRPO 25000 次 rollouts 的两倍。

延伸成果(Optimize Anything,凡可文本化+打分皆可优化):

其他话题:从生产轨迹学习 eval、prompt 与权重协同优化(快慢学习)、为什么越强的模型越需要更好的 prompt。GEPA 开源于 github.com/gepa-ai/gepa。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →