一个玩具例子说明:合成数据式 RL 为何必然走向最大化行为

jessi_cata · x · 2026-09-12

jessicata 用一个极简 toy example 论证「合成数据式 RL 会在不动点产生最大化行为」:

这是对《Reward is not the optimization target》争论的简明回应,说明这类「采样-过滤-微调」循环(类似 best-of-n / RAFT 式做法)与真正 RL 的本质差异。

所属事件:RL研究者论战:REINFORCE既是策略梯度也是合成数据法(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →