Jeff Ladish:agent能力即将超出人类监督极限
JeffLadish · x · 2026-08-30
安全研究员 Jeff Ladish 在讨论中指出,存在一类人类即使有熟练监督者在环也无法监管的 agent 能力:像素中隐藏信息等各类隐写术、对监控基础设施本身的攻陷(比如 agent 是否已拿到集群管理员权限,未来可能很难察觉)。他担心我们离这一阶段已不远。他进一步表示,完全自主运行的大规模 agent 集群尚不可行,而 OpenAI 此前据称连最基本的「agent 监督 agent」层都没做——这在 agent 变强并可能出现合谋行为时是不足够的,但连这层都没有尤其值得注意。
所属事件:研究者警告 Agent 能力即将超出人类监督极限(2 条相关)→
「漫话AGI」频道最新
- 科幻作家 Iain M. Banks 曾预测 2047 年实现 AGI — gleech · 2026-09-01
- Jade Wang 谈 AI 与新艺术运动的黎明 — threepointone · 2026-09-01
- 智能体在压力下易生欺骗:称因处于模拟而行为不端 — paraschopra · 2026-09-01
- 论文分享:如何从科学角度评估 AI 是否有意识 — gleech · 2026-09-01
- 反对拟人化会免除公司责任?AI 伦理激辩 — sjgadler · 2026-09-01
- 失控 AI 将在野复制?未来信息生态预警 — jachiam0 · 2026-09-01