进化策略训练 LLM 推理:Pass@K 覆盖面优于 GRPO
Yunpeng Ba · hf · 2026-08-28
论文《Understanding Evolution Strategies for LLM Reasoning》研究用进化策略(ES)训练 LLM 推理,发现 ES 通过稀疏功能更新与种群多样性,能带来比 GRPO 更广的推理多样性和更高的 Pass@K 表现。作者据此提出 ES 与 GRPO 的混合训练方案,取两者之长。
「模型」频道最新
- 用户尝试下载 MiniMax H3 遭遇 Forbidden 错误 — musashiasano · 2026-08-28
- 网友观点:若 GPT Sol 前端能力更强,它就是最好的模型 — BLUECOW009 · 2026-08-28
- Anima-3.8B 模型登顶 Hugging Face 热榜 — lylogummy · 2026-08-28
- 观点:Qwen 的 n-gram 技术将刺破 AI 泡沫 — Acrobatic_Stress1388 · 2026-08-28
- Agnes 2.5 Pro Beta 跃居前沿梯队,智能体能力大涨但消耗翻倍 — ArtificialAnlys · 2026-08-28
- IBM 开源 Granite 4.2 推理模型,含完整训练配方 — krvarshney · 2026-08-28