进化策略比肩策略梯度,LLM微调研究获最佳论文亚军

caglarml · x · 2026-10-10

论文《Dimension Is Free, Horizon Is Not: When Evolution Strategies Rival Policy Gradients for LLM Fine-Tuning》获 Best Paper Runner-up。该研究比较进化策略(ES)与策略梯度方法在 LLM 微调中的表现,结论是进化策略可以与策略梯度一较高下——「维度是免费的,视野长度才是瓶颈」,为 RL 微调路线提供了 RLHF 主流范式之外的参考。作者是 Catherine Liang 等,具体获奖会议场合原文未明示。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →