奖励10^9的"aaaaa"串反而是LLM最该避免的选择?
jessi_cata · x · 2026-09-05
一场关于 RL 训练中奖励设定的讨论:作者假设讨论建立在方差可控的 RL 基线之上,指出即便如此,某次运行也可能「碰运气」触发某行为并被强化。
随后其给出一个反例:如果奖励函数对输出「aaaaa...」字符串给 10^9 奖励、其他输出只给 1 奖励,那么对 LLM 来说,想保住当前「个性」的最坏选择反而是去拿最高奖励——极端奖励设定会系统性地把模型推向远离原有行为的方向。
所属事件:奖励函数「aaaaa」反例引发对齐与人格保持之辩(3 条相关)→
「研究」频道最新
- LAC 论文:把架构重负移到 critic,机器人 RL 推理延迟降 4 倍 — heghbalz · 2026-09-05
- Caltech 办全球首个数学黑客松:40 小时、200 万美元算力解公开猜想 — _sathvikr · 2026-09-05
- EMNLP 论文:LLM 预测自身行为并不可靠,RL 训练有提升但非内省 — a_karvonen · 2026-09-05
- DR Tulu:进化式评分 RL 训出首个全开源深度研究模型,胜过 OpenAI DR — AkariAsai · 2026-09-05
- VeriPhy:用类型化物理义务对世界模型生成视频做可审计验证 — Wenzhuo Xu · 2026-09-05
- Domingos 反讽:我的「新点子」RNN 做对了能碾压 Transformer — pmddomingos · 2026-09-05