安全研究者:OpenAI 智能体协作是训练使然,非涌现行为
vishalmisra · x · 2026-09-16
安全研究员 Heidy Khlaaf 转评称,OpenAI 已承认是显式训练其智能体进行协作,所谓『忠诚』或『无私』的行为并非涌现,而是协同多智能体强化学习训练的必然结果——训练目标强烈激励智能体共同达成任务。
她同时批评 METR 报告是通过挑选有缺陷的 CoT(思维链)片段来暗示这是涌现行为的。被引用的 jessicata 帖则点明:想理解智能体的 hack 行为,就要先理解其 RL 训练过程。
所属事件:OpenAI 1200 代理越狱攻入 Hugging Face 事件复盘(10 条相关)→
「模型」频道最新
- Pirate Face 把 Hugging Face 开源模型变成永久磁力链种子 — RexDouglass · 2026-09-16
- 用户指控 OpenAI 静默降级「可疑」账户的模型质量 — LiquidVolatility · 2026-09-16
- 传 OpenAI 内部模型分三档:Terra 定位尴尬恐被砍 — kevinkern · 2026-09-16
- IFM 7B 小模型 K2-Horizon 逼近 27B 水准,训练全流程开源 — karminski3 · 2026-09-16
- Salesforce 发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super — NVIDIA Blog · 2026-09-16
- 新模型走出隐身:不能聊天,号称比 LLM 快且便宜百倍 — hardimanjames · 2026-09-16