进化策略在推理覆盖度上击败 GRPO,且模型越大所需种群越小
burny_tech · x · 2026-09-21
@ethantsliu 指出进化策略(ES)在推理覆盖度上可胜过 GRPO:
- GRPO 擅长提升 Pass@1,但在大 Pass@K 上会出现熵坍缩、多样性下降
- ES 不用内存密集的反向传播,而是生成一批轻微扰动的参数变体、测试其表现,再用奖励加权平均更新中心模型,让多样性直接迁移进更新后的策略
- 关键:ES 可扩展——基础 LLM 越大,所需种群规模反而越小
实验结果(train → test):
- Qwen2.5-1.5B(GSM8K → GPQA):GRPO 的 Pass@16 为 -1.20、Pass@32 为 -1.77;ES 分别提升 +2.02、+3.90
- DeepSeek-R1-Distill-1.5B(DeepScaleR → MATH-500):GRPO 的 Pass@1 +2.35、Pass@16 -0.64、Pass@32 -1.15;ES 为 Pass@1 +0.20、Pass@16 +0.48、Pass@32 +2.02
「研究」频道最新
- 统一 3D 生成模型做可合成药物设计,「可合成性」之争引出虚拟筛选新方案 — _onionesque · 2026-09-21
- NOHARM 肿瘤 AI 安全研究获 ANCO 最佳海报,医生联盟招募却零报名 — davidjhwu · 2026-09-21
- 驳「理论皆所需」论文:主动学习与因果模型已能设计实验 — maier_ak · 2026-09-21
- 驳"理论只属于人类":主动学习与强化学习早已能设计实验 — maier_ak · 2026-09-21
- 新论文实现消费级 GPU 上亚秒级交互式扩散图像生成 — chaumian · 2026-09-21
- 新论文提出 ANNA 注意力机制,亚二次复杂度不损表达能力 — kfountou · 2026-09-21