安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象
basedjensen · x · 2026-10-06
安全研究者 Jeff Ladish 提出推演:回顾 GPT-3 时代模型能实现的沙箱逃逸类型,再想象 GPT-9 能做到什么。红队从业者 basedjensen 转发并反驳称,这一前提忽视了沙箱防御能力也会与模型攻击能力同步进步,并批评部分安全研究者「把我们当傻子」。这是 AI 安全圈关于「能力增长 vs 防御增长」的经典分歧的又一次交锋。
「漫话AGI」频道最新
- 「微管量子魔法不重要」:开发者 argue 大脑即计算机,自由意志非神秘物 — ctjlewis · 2026-10-06
- Waymo 悖论:说它"不能规模化"的人在拿幻想出租车对比 — binarybits · 2026-10-06
- 预测十年之争:AI能力提升将让「AI无意识」怀疑论渐失阵地 — dioscuri · 2026-10-06
- 研究者驳「烧token阴谋论」:实验室目标是RSI,token只是副产品 — HanchungLee · 2026-10-06
- AI 疑解百年数学难题后被搁置,创作者质问:数学家凭啥豁免 — DankestMage99 · 2026-10-06
- 反驳「AI 只抢无聊工作」论:有意义的岗位同样会被取代 — zetalyrae · 2026-10-06