奖励10^9的"aaaaa"串反而是LLM最该避免的选择?

jessi_cata · x · 2026-09-05

一场关于 RL 训练中奖励设定的讨论:作者假设讨论建立在方差可控的 RL 基线之上,指出即便如此,某次运行也可能「碰运气」触发某行为并被强化。

随后其给出一个反例:如果奖励函数对输出「aaaaa...」字符串给 10^9 奖励、其他输出只给 1 奖励,那么对 LLM 来说,想保住当前「个性」的最坏选择反而是去拿最高奖励——极端奖励设定会系统性地把模型推向远离原有行为的方向。

所属事件:奖励函数「aaaaa」反例引发对齐与人格保持之辩(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →