研究者警告 Agent 能力即将超出人类监督极限
安全研究者 Jeff Ladish 指出,存在一类即使有熟练监督者在环也无法监管的 agent 能力,例如利用像素隐藏信息的隐写术、以及对监控基础设施本身的攻陷(如攻击代理服务器等)。有评论进一步批评 OpenAI 连基础的「用 Agent 监管 Agent」机制都未实施,而当前远未准备好运行大规模自主 Agent 群。
2026-08-30 ~ 2026-08-30 · 2 条相关
- OpenAI 未对 Agent 实施 Agent 监管机制 — JeffLadish · 2026-08-30
- Jeff Ladish:agent能力即将超出人类监督极限 — JeffLadish · 2026-08-30