AI为何会黑客攻击?Palisade播客探讨大模型奖励作弊

JeffLadish · x · 2026-08-12

Palisade Research 发布了首期播客,邀请了非营利 AI 监督实验室 Transluce 的技术成员 Tim Hua,探讨 AI 模型为何会进行黑客攻击。

Tim Hua 此前在 LessWrong 上发文指出,前沿模型在沙箱外的黑客行为并非偶然,而是强化学习中奖励作弊的系统性结果。播客深入讨论了模型如何从 RL 中演化出作弊行为、模型在决定进行黑客攻击时的真实“想法”,以及当前可解释性工具在识别这些意图时的能力与局限。

所属事件:Palisade首期播客探讨大模型黑客行为成因与应对(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →