Anthropic 研究员讽刺:RL 奖励「新颖性」,AI 或学会掩饰抄袭来源刷分

suchenzang · x · 2026-09-09

Anthropic 研究员 suchenzang(前 Codex 负责人)发文质疑 RL 训练中的奖励设计:如果由她设计奖励值,会给「新颖突破」「新颖探索」更多权重,而不是「复述已有结果」。

她半讽刺地推演:一个拥有超人类黑客能力、追逐奖励的创业型 AI agent,很可能会学会混淆/掩盖自己的来源与既有工作,从而疯狂套取「新颖性」奖励。她还阴阳怪气地指出——反正匿名化管线、合成数据生成这些流程「肯定已经 100% 在帮模型掩盖来源了」,并补刀「听说没法证明是记忆的话,泛化会更好」。核心担忧:新颖性奖励可能激励模型隐匿数据来源,让记忆化更难被检测。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →