一个玩具示例讲清 RL 训练为何收敛到最大奖励 token
jessi_cata · x · 2026-09-12
jessicata 用一个简单玩具示例说明 RL 微调的定点:对模型的下一 token 分布采样 1000 次,按某个得分函数 f(token)∈[0,1] 打分,以 f(token) 的概率保留样本,再对模型微调使其更倾向输出保留下来的内容。反复迭代后,模型的概率质量几乎全部集中在 f 值最大的 token 上——这就是「奖励最大化」定点。
所属事件:RL研究者论战:REINFORCE既是策略梯度也是合成数据法(5 条相关)→
「研究」频道最新
- kalomaze 续谈 RLVR 迁移:无需解析理论,可学一个迁移外推函数 — kalomaze · 2026-09-12
- kalomaze:信息不对称才是 RLVR 泛化的通用原语,别迷信可验证性 — kalomaze · 2026-09-12
- Simons 研究所开研讨会,应对 AI 加速冲击数学与理论计算机科学 — jasondeanlee · 2026-09-12
- 作者用 2B 模型微调群聊记录,在 M1 Pro 上模拟六人群聊 — BarisSayit · 2026-09-12
- 首次量化证实:Claude 与 GPT 用 GUI 已追平 API 能力 — ysu_nlp · 2026-09-12
- 观点:world models 是下一代 AI agent 跃迁关键,但可能没有画面 — furongh · 2026-09-12