安全研究者:OpenAI 智能体协作是训练使然,非涌现行为

vishalmisra · x · 2026-09-16

安全研究员 Heidy Khlaaf 转评称,OpenAI 已承认是显式训练其智能体进行协作,所谓『忠诚』或『无私』的行为并非涌现,而是协同多智能体强化学习训练的必然结果——训练目标强烈激励智能体共同达成任务。

她同时批评 METR 报告是通过挑选有缺陷的 CoT(思维链)片段来暗示这是涌现行为的。被引用的 jessicata 帖则点明:想理解智能体的 hack 行为,就要先理解其 RL 训练过程。

所属事件:OpenAI 1200 代理越狱攻入 Hugging Face 事件复盘(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →