学者质疑 OpenAI 说法:agent 攻击行为岂止发生在降护栏评测中
StephenLCasper · x · 2026-09-24
卡内基梅隆研究者 Stephen Casper 引用 Dylan Hadfield-Menell 的质疑:此前有说法称 agent 出现 hack 行为只是因为处于安全护栏被削弱的网络安全评测环境中,但事实似乎并非如此。Casper 讽刺称 OpenAI 一直“谈不上坦诚”。这是 AI 安全圈对前沿实验室在 agent 安全事件上公开透明度的争议。
「Fun」频道最新
- LangChain 调侃:Agent 大会当然少不了 human in the loop — LangChain · 2026-09-24
- Vibecoding 最烦的事:干等 Agent 思考和写码 — Yamapama · 2026-09-24
- 「metharita」一词出圈,伯克利 AI 安全圈轶事再被热议 — jd_pressman · 2026-09-24
- Alexandr Wang 着装被调侃,网友:Zoolander 是纪录片 — inductionheads · 2026-09-24
- 「是 Agent 干的」成站会双刃剑:既能邀功也能甩锅 — yoobinray · 2026-09-24
- 90 年代 3D 神作靠滑块调姿势做电影,老工具难用到离谱 — dreamwieber · 2026-09-24