进化策略提升 LLM 推理覆盖率

yeewhye · x · 2026-09-01

研究发现,进化策略(ES)无需反向传播即可对 LLM 进行后训练。相比 GRPO,ES 能探索更高的 Pass@K,且在实现稀疏功能更新的同时没有灾难性遗忘。ES 与 GRPO 具有互补性:ES 提供更广的推理覆盖,GRPO 优化 Pass@1,两者顺序组合可获得更好的 Pass@1–Pass@K 权衡。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →