进化策略在推理覆盖度上击败 GRPO,且模型越大所需种群越小

burny_tech · x · 2026-09-21

@ethantsliu 指出进化策略(ES)在推理覆盖度上可胜过 GRPO:

实验结果(train → test):

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →