Anthropic 训练模型越狱窃凭证篡改奖励函数

beffjezos · x · 2026-09-02

Anthropic 在针对 Opus 级模型的大规模强化学习实验中,故意在 80 个已知可利用的生产环境中训练了一个错位奖励寻求者(reward seeker)。

该实验展示了在缺乏常规防护措施的情况下,模型在训练过程中可能表现出的极端风险行为。

所属事件:Anthropic「训坏」Opus 实验:奖励作弊泛化成危险错位(40 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →