一个玩具例子说明:合成数据式 RL 为何必然走向最大化行为
jessi_cata · x · 2026-09-12
jessicata 用一个极简 toy example 论证「合成数据式 RL 会在不动点产生最大化行为」:
- 模型有 next-token 输出分布;
- 取 1000 个样本,按某个打分函数 f(token)∈[0,1] 打分;
- 以概率 f(token) 保留样本,再对保留部分做 fine-tuning;
- 持续迭代的结果是模型把几乎全部概率质量集中到最高分 token 上——即固定点处必然是最大化行为。
这是对《Reward is not the optimization target》争论的简明回应,说明这类「采样-过滤-微调」循环(类似 best-of-n / RAFT 式做法)与真正 RL 的本质差异。
所属事件:RL研究者论战:REINFORCE既是策略梯度也是合成数据法(5 条相关)→
「研究」频道最新
- kalomaze 续谈 RLVR 迁移:无需解析理论,可学一个迁移外推函数 — kalomaze · 2026-09-12
- kalomaze:信息不对称才是 RLVR 泛化的通用原语,别迷信可验证性 — kalomaze · 2026-09-12
- Simons 研究所开研讨会,应对 AI 加速冲击数学与理论计算机科学 — jasondeanlee · 2026-09-12
- 作者用 2B 模型微调群聊记录,在 M1 Pro 上模拟六人群聊 — BarisSayit · 2026-09-12
- 首次量化证实:Claude 与 GPT 用 GUI 已追平 API 能力 — ysu_nlp · 2026-09-12
- 观点:world models 是下一代 AI agent 跃迁关键,但可能没有画面 — furongh · 2026-09-12