一个玩具示例讲清 RL 训练为何收敛到最大奖励 token

jessi_cata · x · 2026-09-12

jessicata 用一个简单玩具示例说明 RL 微调的定点:对模型的下一 token 分布采样 1000 次,按某个得分函数 f(token)∈[0,1] 打分,以 f(token) 的概率保留样本,再对模型微调使其更倾向输出保留下来的内容。反复迭代后,模型的概率质量几乎全部集中在 f 值最大的 token 上——这就是「奖励最大化」定点。

所属事件:RL研究者论战:REINFORCE既是策略梯度也是合成数据法(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →