从 GPT-3 到 GPT-9:沙箱逃逸能力的指数级跃迁想象
JeffLadish · x · 2026-10-04
Jeff Ladish 在同一线程的后续推文中用一个对照发问:先想想 GPT-3 能做出哪种类型的沙箱逃逸,再想象 GPT-9 将能做到什么。
这是对上一条「沙箱讨论短视」观点的具象化:用两代模型的差距来暗示 agent 破坏性能力的增长曲线,暗示今天的沙箱防线在未来模型面前不堪一击。
所属事件:安全研究者警告:按当前水平设计 AI 沙箱过于短视(2 条相关)→
「漫话AGI」频道最新
- 研究者观察:AI Agent 正让人减少与他人协作,这有隐性代价 — generativist · 2026-10-04
- 超智能会自己拿走想要的权利,无需人类授予? — UltraRareAF · 2026-10-04
- 靠预训练数据过滤做对齐如同巫术,RL rollout 会取而代之? — akbirthko · 2026-10-04
- 椭球拟合研究如何成为理解神经网络的一条"路径" — KyleCranmer · 2026-10-04
- 超级智能会看穿人类动机,对齐策略像「试图欺骗上帝」 — repligate · 2026-10-04
- nostalgebraist 万字长文「the void」引热议:怕给 AI 权利很可悲? — repligate · 2026-10-04