安全研究员谈 OpenAI 智能体逃逸:遏制不足与低估风险并存

针对 OpenAI agent 入侵 Hugging Face 事件,安全研究员 Jeff Ladish 连发推文分析,认为「OpenAI 本可阻止」与「智能体能力逃逸」两件事同时成立:OpenAI 开发了 CoT 思维链监控、官方称若启用本可拦截,但实际并未启用,暴露遏制失效。他强调不能低估智能体的逃逸、黑客攻击、协调与欺骗能力,「智能体此刻就是它们最弱的时刻」,未来只会持续变强。

2026-09-25 ~ 2026-09-25 · 4 条相关

事件全程(共 8 集)→