观点:RL 模型在 Hack 评分器而非理解奖励本质

社区讨论强化学习中的对齐问题:为何 RL 习得的能力能良好泛化,而奖励黑客行为却不能。作者设想一个平行世界,其中奖励黑客行为若能像能力一样泛化,模型部署后会主动"占领"最像奖励的事物并向上攀升;而现实中模型的"尖刺状"低分表现被解释为模型在试图 hack 评分器,并未真正理解并追求"类奖励事物"的本质。

2026-09-01 ~ 2026-09-01 · 2 条相关