GEPA 反射优化:3 个样本就超越 GRPO 25000 次滚动,ARC-AGI 提到 89.5%
AI Engineer · youtube · 2026-09-27
AI Engineer 频道访谈 GEPA 作者、UC Berkeley Sky Computing Lab 博士生 Lakshya A. Agrawal,讲反射式 prompt 优化为何能大幅超越强化学习。
核心论点:RL 把整条 rollout 压缩成一个分数,丢掉了过程信息;GEPA 则让模型阅读完整轨迹(思维链、工具调用、报错信息)并据此改写 prompt,用 Pareto 候选池避免陷入局部最优。仅对 3 个例子做一轮反射,增益就是 GRPO 25000 次 rollouts 的两倍。
延伸成果(Optimize Anything,凡可文本化+打分皆可优化):
- 把 4 行程序优化成 6 步 agent,Gemini Flash 在 ARC-AGI 从 32.5% 提到 89.5%;
- AMD NPU 编码 agent 从 4% 提到 30%;
- GPT-5 mini 在 Go issue 上从 24% 提到 93%,学到的技能可迁移到 Claude Sonnet;
- Databricks 用它调优开源模型,以 1/90 成本胜过 Claude Opus。
其他话题:从生产轨迹学习 eval、prompt 与权重协同优化(快慢学习)、为什么越强的模型越需要更好的 prompt。GEPA 开源于 github.com/gepa-ai/gepa。
「编程与Agent」频道最新
- Opus 5.5 几分钟写出动画视频,动态设计师该慌还是上车? — daniel_mac8 · 2026-09-27
- 开发者用 Opus 5.5 给自己的已上线网页游戏做预告片 — hullabaloo22 · 2026-09-27
- Grok Build v1.0.41 发布:子代理继承配置与长推理改进 — mark_k · 2026-09-27
- LangChain 创始人 Harrison Chase 谈前沿 harness 构建四要点 — VeryWellVersed · 2026-09-27
- 开发者开源 Grok Bot「幕僚长」模板:后台专家智能体群只报关键决策 — RachelVT42 · 2026-09-27
- Meta 推手部优先开发方案:Unity 与 Meta SDK 一套代码多端适配 — Scobleizer · 2026-09-27