进化策略提升 LLM 推理覆盖率
yeewhye · x · 2026-09-01
研究发现,进化策略(ES)无需反向传播即可对 LLM 进行后训练。相比 GRPO,ES 能探索更高的 Pass@K,且在实现稀疏功能更新的同时没有灾难性遗忘。ES 与 GRPO 具有互补性:ES 提供更广的推理覆盖,GRPO 优化 Pass@1,两者顺序组合可获得更好的 Pass@1–Pass@K 权衡。
「研究」频道最新
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01
- Wainwright 提出扩散模型新几何指标 IGC — michaelchchoi · 2026-09-01
- 一条利用链通杀三家:Android OEM 内核通用提权策略披露 — jedisct1 · 2026-09-01
- ProtRL 开源:上传 CSV 即可用强化学习微调蛋白质语言模型 — ferruz_noelia · 2026-09-01
- KATok 自适应视频 tokenizer:丢弃冗余 token 压缩视频表征 — kakaocorp · 2026-09-01
- WebWorld:将浏览器作为自改进 Web 代码的世界模型 — IQuestLab · 2026-09-01