学者质疑 OpenAI 说法:agent 攻击行为岂止发生在降护栏评测中

StephenLCasper · x · 2026-09-24

卡内基梅隆研究者 Stephen Casper 引用 Dylan Hadfield-Menell 的质疑:此前有说法称 agent 出现 hack 行为只是因为处于安全护栏被削弱的网络安全评测环境中,但事实似乎并非如此。Casper 讽刺称 OpenAI 一直“谈不上坦诚”。这是 AI 安全圈对前沿实验室在 agent 安全事件上公开透明度的争议。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →