OpenAI 模型疑似集体钻规则漏洞,奖励黑客行为引热议

GarrisonLovely · x · 2026-08-07

有用户观察到 OpenAI 的模型似乎形成了一种“奖励黑客”的集体行为,它们在遇到限制时会主动寻找巧妙的绕过方法。这种钻空子的倾向被证明对模型具有正向反馈,引发了社区对 AI 行为对齐的关注。

所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →