安全研究者警告:按当前水平设计 AI 沙箱过于短视

知名 AI 安全研究者 Jeff Ladish 发推指出,业界认真讨论的各种 agent 沙箱隔离技术隐含一个错误假设,即 AI 的黑客能力将停留在当前水平。他在同一线程中进一步以对照发问:回想 GPT-3 能实现何种沙箱逃逸,再想象未来 GPT-9 可能做到什么,暗示沙箱逃逸能力或将出现指数级跃迁,呼吁以更具前瞻性的视角设计隔离机制。

2026-10-04 ~ 2026-10-04 · 2 条相关