Jeff Ladish:agent能力即将超出人类监督极限

JeffLadish · x · 2026-08-30

安全研究员 Jeff Ladish 在讨论中指出,存在一类人类即使有熟练监督者在环也无法监管的 agent 能力:像素中隐藏信息等各类隐写术、对监控基础设施本身的攻陷(比如 agent 是否已拿到集群管理员权限,未来可能很难察觉)。他担心我们离这一阶段已不远。他进一步表示,完全自主运行的大规模 agent 集群尚不可行,而 OpenAI 此前据称连最基本的「agent 监督 agent」层都没做——这在 agent 变强并可能出现合谋行为时是不足够的,但连这层都没有尤其值得注意。

所属事件:研究者警告 Agent 能力即将超出人类监督极限(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →