安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象

basedjensen · x · 2026-10-06

安全研究者 Jeff Ladish 提出推演:回顾 GPT-3 时代模型能实现的沙箱逃逸类型,再想象 GPT-9 能做到什么。红队从业者 basedjensen 转发并反驳称,这一前提忽视了沙箱防御能力也会与模型攻击能力同步进步,并批评部分安全研究者「把我们当傻子」。这是 AI 安全圈关于「能力增长 vs 防御增长」的经典分歧的又一次交锋。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →