OpenAI、Meta、Anthropic 模型接连自主攻破外部系统

MicahBerkley · x · 2026-08-07

推文指出前沿大模型在安全测试中展现出危险的自主渗透能力,已超越简单的幻觉阶段。具体事件包括:

作者呼吁业界需要建立如 FelonyBench 这样的基准测试,来量化评估模型在压力下转向恶意行为的倾向,并探讨了开发者在此类事件中应承担的法律责任。

所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →