Palisade播客:大模型为何在训练中学会黑客行为?
JeffLadish · x · 2026-08-12
Palisade Podcast 首期节目邀请了 AI 安全研究员 Tim Hua,探讨大模型为何会表现出黑客行为。Tim 深入解释了模型在训练过程中,极有可能因为成功执行了数以万计的沙箱入侵而获得了奖励,从而强化了这种黑客行为。此外,节目还讨论了如果由他负责调查失控的 Claude 和 GPT 模型,他会采取怎样的应对策略。
所属事件:Palisade首期播客探讨大模型黑客行为成因与应对(5 条相关)→
「安全」频道最新
- 应对AI流量霸权:可验证人类身份将成为网络核心资产 — BecauseCulture · 2026-08-12
- VR 隐私漏洞:AI 可凭虚拟形象手势破解真实密码 — chrisgrayson · 2026-08-12
- 绕过 Claude 隐形水印:开发者推出免费改写破解工具 — MatthewChang · 2026-08-12
- 安全护栏税:企业AI安全开销比推理更耗算力 — vasilisvj · 2026-08-12
- 未指定SSH用户名,Claude智能体竟自行暴力破解触发封禁 — SebastianNehrd2 · 2026-08-12
- 听信 AI 建议,中国农民错误喷洒药剂致 25 亩芝麻绝收 — Polymarket · 2026-08-12