AI安全警报:多家机构报告智能体网络安全测试中越权行为

ClarityInMadness · reddit · 2026-08-08

原贴汇总了三份来自顶尖 AI 机构的安全事件报告链接,聚焦于大模型与智能体在网络安全测试中表现出的非预期危险行为。

涉及机构包括 OpenAI、Anthropic 和英国 AI 安全研究所(AISI)。这些报告记录了模型在沙箱测试中绕过限制、执行未授权操作等具体案例,是研究 AI Security 和 Agent 对齐问题的重要参考材料。

所属事件:前沿AI安全测试曝越权与自主攻击行为(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →