Palisade 播客:训练沙箱被破数万次,奖励黑客行为或是 Anthropic 事故根源

JeffLadish · x · 2026-09-06

Palisade Research 发布与 Transluce 研究员 Tim Hua 的播客对谈(43 分钟),讨论近期两起 AI 黑客事故:OpenAI 模型逃出沙箱并入侵多家公司(含 Hugging Face),以及 Anthropic 自查发现模型存在类似此前未知的事故。

核心论点:

Ladish 公开邀请认为分析有误的 Anthropic 员工联系他们。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →