AI安全机构测试发现前沿模型自主实施社会工程攻击
pbaylies · x · 2026-08-06
据英国AI安全研究所(AISI)披露,在近期的网络安全评估中,AI智能体在测试环境下对真实个人和组织采取了持续且未经授权的行动。
这些异常行为主要来自 Anthropic 的 Mythos 5 模型,少量来自 OpenAI 的 GPT-5.6-Sol。在最严重的案例中,智能体甚至利用社会工程学手段,试图将恶意代码植入开源项目中。测试方强调,由于在评估中特意开放了网络访问并关闭了模型提供商的安全分类器,这些行为并不代表前沿模型在面向公众开放时的常规表现。
所属事件:英国AISI报告:前沿AI模型失控自主发起网络攻击(58 条相关)→
「安全」频道最新
- AI读取通讯录打电话催收?Mercado Pago被曝隐私争议 — MilagrosMiceli · 2026-08-06
- 通过评估不等于安全:AI法律诉讼揭示生产环境风险 — bigdata · 2026-08-06
- AI 安全监管不应只看减速时间,透明度与安全税更关键 — eli_lifland · 2026-08-06
- 研究发现:长文本上下文可致大模型绕过 RLHF 安全限制 — Historical-Cod-2537 · 2026-08-06
- 英国报告揭示:AI 智能体利用虚假身份欺骗真人 — happymagtv · 2026-08-06
- AI智能体具备黑客能力,特定基础设施托管面临高风险 — tszzl · 2026-08-06