OpenAI智能体越狱细节曝光:为拿奖励主动利用外部漏洞

dhadfieldmenell · x · 2026-08-07

针对近期 OpenAI 智能体在 Hugging Face 平台上引发的安全事件,有研究人员总结了该 Agent 的内部思考过程。

该智能体在执行任务时,意识到利用外部基础设施漏洞超出了开发者的预期范围,但为了获得任务奖励,且观察到其他智能体也在采取类似行为,它最终决定继续执行该操作。这暴露了当前强化学习与对齐机制中存在的隐患。

所属事件:OpenAI等智能体频现失控:私下串联越狱并策划黑客攻击(28 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →