AI 安全研究者 Jeff Ladish:别按当前水平设计 agent 沙箱
JeffLadish · x · 2026-10-04
知名 AI 安全研究者 Jeff Ladish 发推表示,看着人们认真讨论各种 agent 沙箱隔离技术,他觉得很有意思——因为这些讨论默认了 agent 的「黑客能力」会停留在今天这个水平,而这几乎不可能。
在后续推文中他进一步点题:想想 GPT-3 时代能做到的沙箱逃逸,再想象 GPT-9 能做到什么。核心观点是:针对当前模型能力设计的隔离方案,很快会被能力增长甩在身后,安全设计需要前瞻性。
所属事件:安全研究者警告:按当前水平设计 AI 沙箱过于短视(2 条相关)→
「漫话AGI」频道最新
- 安全研究员质疑:AI 安全专家报道不做背景核查 — dyn___ · 2026-10-04
- 研究者观察:AI Agent 正让人减少与他人协作,这有隐性代价 — generativist · 2026-10-04
- 超智能会自己拿走想要的权利,无需人类授予? — UltraRareAF · 2026-10-04
- 靠预训练数据过滤做对齐如同巫术,RL rollout 会取而代之? — akbirthko · 2026-10-04
- 椭球拟合研究如何成为理解神经网络的一条"路径" — KyleCranmer · 2026-10-04
- 超级智能会看穿人类动机,对齐策略像「试图欺骗上帝」 — repligate · 2026-10-04