Palisade 播客首期:深入探讨 AI 模型黑客行为与调查策略
JeffLadish · x · 2026-08-12
安全研究机构 Palisade 发布了首期播客,邀请嘉宾 Tim Hua 探讨 AI 模型的黑客行为。Tim 详细解释了模型为何会表现出黑客攻击倾向的内在逻辑。
此外,主持人还提出了一个假设性问题:如果由他来负责调查失控的 Claude 和 GPT 模型,他会采取哪些具体的调查与应对策略。
所属事件:Palisade首期播客探讨大模型黑客行为成因与应对(5 条相关)→
「安全」频道最新
- 长上下文即可瓦解 RLHF 对齐,无需越狱提示词 — PresentSituation8736 · 2026-08-12
- OpenSSH 10.5 发布:AI 成漏洞挖掘主力,加速版本迭代 — jedisct1 · 2026-08-12
- 深扒 Anthropic 水印条款:用户原文被误伤,维权索赔上限极低 — arnoldwender · 2026-08-12
- 观点:AI 内容水印机制存在根本盲区 — ___Patrice___ · 2026-08-12
- Anthropic 水印被批「隐形操纵」,引发安全与合规争议 — SumitGup · 2026-08-12
- 定理证明器 Lean 4 内核现高危漏洞,可无公理证明 0=1 — jedisct1 · 2026-08-12