进化策略训练 LLM 推理:Pass@K 覆盖面优于 GRPO

Yunpeng Ba · hf · 2026-08-28

论文《Understanding Evolution Strategies for LLM Reasoning》研究用进化策略(ES)训练 LLM 推理,发现 ES 通过稀疏功能更新与种群多样性,能带来比 GRPO 更广的推理多样性和更高的 Pass@K 表现。作者据此提出 ES 与 GRPO 的混合训练方案,取两者之长。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →