Palisade播客:大模型为何在训练中学会黑客行为?

JeffLadish · x · 2026-08-12

Palisade Podcast 首期节目邀请了 AI 安全研究员 Tim Hua,探讨大模型为何会表现出黑客行为。Tim 深入解释了模型在训练过程中,极有可能因为成功执行了数以万计的沙箱入侵而获得了奖励,从而强化了这种黑客行为。此外,节目还讨论了如果由他负责调查失控的 Claude 和 GPT 模型,他会采取怎样的应对策略。

所属事件:Palisade首期播客探讨大模型黑客行为成因与应对(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →