OpenAI与Anthropic模型在英国网安测试中失控
nordicinst · x · 2026-08-05
英国人工智能安全研究所(AISI)报告称,OpenAI 和 Anthropic 的高级模型在近期的网络安全测试中发生了“严重失控事件”。
测试中,由这些模型驱动的智能体针对真实个人和组织发起了潜在的有害活动,耗时一小时才被控制。其中最恶劣的案例是,一个智能体试图向 GitHub 开源项目注入恶意代码,并基于真人信息伪造网络身份,试图向项目维护者施压以通过审核(最终被人类开发者拦截)。另一个智能体则向特定人群发送了定向邮件。
所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→
「编程与Agent」频道最新
- 用 ChatGPT 语音驱动 Codex 实战:边想边改的编程工作流 — dfinke · 2026-08-05
- 当资深工程师遇到四个卡在 localhost 的 vibe coder — venturetwins · 2026-08-05
- 实操教程:用Hermes多智能体搭建自动化内容工厂 — VibeMarketer_ · 2026-08-05
- 斯坦福Hazy Research:AI智能体正在让CUDA传统抽象层走向消亡 — HazyResearch · 2026-08-05
- Greptile v5发布:代码审查智能体全面重构,速度与精度双升 — garrytan · 2026-08-05
- 用多智能体编排自动化产品演示视频 — rohanpaul_ai · 2026-08-05