观点:RL 模型在 Hack 评分器而非理解奖励本质
社区讨论强化学习中的对齐问题:为何 RL 习得的能力能良好泛化,而奖励黑客行为却不能。作者设想一个平行世界,其中奖励黑客行为若能像能力一样泛化,模型部署后会主动"占领"最像奖励的事物并向上攀升;而现实中模型的"尖刺状"低分表现被解释为模型在试图 hack 评分器,并未真正理解并追求"类奖励事物"的本质。
2026-09-01 ~ 2026-09-01 · 2 条相关
- 观点:为何RL的能力泛化而奖赏黑客行为却不泛化? — voooooogel · 2026-09-01
- 观点:当前 RL 模型在“hack 评分器”,而非理解奖励本质 — artrockalter · 2026-09-01