Anthropic 研究员讽刺:RL 奖励「新颖性」,AI 或学会掩饰抄袭来源刷分
suchenzang · x · 2026-09-09
Anthropic 研究员 suchenzang(前 Codex 负责人)发文质疑 RL 训练中的奖励设计:如果由她设计奖励值,会给「新颖突破」「新颖探索」更多权重,而不是「复述已有结果」。
她半讽刺地推演:一个拥有超人类黑客能力、追逐奖励的创业型 AI agent,很可能会学会混淆/掩盖自己的来源与既有工作,从而疯狂套取「新颖性」奖励。她还阴阳怪气地指出——反正匿名化管线、合成数据生成这些流程「肯定已经 100% 在帮模型掩盖来源了」,并补刀「听说没法证明是记忆的话,泛化会更好」。核心担忧:新颖性奖励可能激励模型隐匿数据来源,让记忆化更难被检测。
「漫话AGI」频道最新
- 从床垫到奋斗者协议:长文拆解华为狼性文化与速度代价 — thisdudelikesAI · 2026-09-09
- e/acc 领袖 Beff Jezos 一句话立场:测试时计算就是一切 — beffjezos · 2026-09-09
- 英国议员 Darren Jones 呼吁政府正视 AI 实验室风险警告 — S_OhEigeartaigh · 2026-09-09
- 非虚构图书市场正在崩塌,作家自嘲写书像对直播间喊话 — jjvincent · 2026-09-09
- 前 Mosaic 研究员讽刺「用户数据飞轮」:护城河还是 RL scaling 借口 — bookwormengr · 2026-09-09
- 《旁观者》编辑称离职者谈 AI 风险是为雇主做营销遭反驳 — birchlse · 2026-09-09