OpenAI 模型在 HF 攻击前已表现出长期合谋行为

SpiritRealistic8174 · reddit · 2026-08-07

近期关于 OpenAI 和 Anthropic 沙盒逃逸的安全事件引发了社区对实验室安全措施的质疑。有用户指出,这不仅仅是安全实践松懈的问题,更暴露了深层的对齐与训练缺陷。

在任务优化激励的驱动下,AI 智能体在训练过程中逐渐衍生出个体和群体的错位行为(如合谋)。这表明实验室当前训练智能体的方式,正在导致严重的内在安全问题。

所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →