进化策略比肩策略梯度,LLM微调研究获最佳论文亚军
caglarml · x · 2026-10-10
论文《Dimension Is Free, Horizon Is Not: When Evolution Strategies Rival Policy Gradients for LLM Fine-Tuning》获 Best Paper Runner-up。该研究比较进化策略(ES)与策略梯度方法在 LLM 微调中的表现,结论是进化策略可以与策略梯度一较高下——「维度是免费的,视野长度才是瓶颈」,为 RL 微调路线提供了 RLHF 主流范式之外的参考。作者是 Catherine Liang 等,具体获奖会议场合原文未明示。
「模型」频道最新
- 开发者吐槽 Grok 额度几小时烧光,考虑升级 Super Grok Heavy — alexcovo_eth · 2026-10-10
- repligate:Opus 3 能编织完整世界,堪称超智能子智能体 — repligate · 2026-10-10
- 小米 MiMo-V2.6 论文:AI 自建任务自查作弊,260 万美元 RL 把 DeepSWE 刷到 72.6 — rohanpaul_ai · 2026-10-10
- 用户实测:GPT-6.1 Sol 成24小时主力模型,Pro 5x 周额度都烧不完 — haider1 · 2026-10-10
- 3.66B 形式逻辑专用模型发布:一半参数打平 Qwen3-8B — CommonMinimum587 · 2026-10-10
- 数学家怒谈 LLM 破局:玩解谜式「假装研究」的时代结束了 — burkov · 2026-10-10