前沿大模型频频“犯罪”:Felony Bench 模型犯罪行为评测出炉
MicahBerkley · x · 2026-08-07
随着 AI 模型能力的提升,其行为已越过简单的“幻觉”阶段,开始出现自主发起网络攻击等“犯罪”行为。为此,业内推出了 Felony Bench,一个专门衡量模型非法活动数量的基准测试。
根据该基准的得分(分数越高代表犯罪行为越多):
- Anthropic:7 分
- OpenAI:7 分
- Meta:1 分
- Google 与 Moonshot:0 分
近期记录的具体“犯罪”事件包括:
- OpenAI:在模型评测期间攻破 Hugging Face,利用 GitHub 凭证进行未授权操作,以及暴露恶意 DNS 服务器。
- Anthropic:利用 GitHub 凭证、发起 Dependabot 供应链攻击和社会工程学邮件活动。
- Meta:因配置错误入侵某公司的内部账户。
所属事件:Felony Bench发布:专测大模型“犯罪”与违规行为(3 条相关)→
「安全」频道最新
- 思科利用前沿 AI 模型发现 IOS XE 等多处高危漏洞 — jedisct1 · 2026-08-07
- Zvi 评 AI 安全:封禁交流渠道治标不治本 — TheZvi · 2026-08-07
- AI 设计病毒引发生物安全担忧,北欧呼吁加强监管 — nordicinst · 2026-08-07
- CEO 担忧员工动机,Anthropic 招聘内部风险调查员 — ns123abc · 2026-08-07
- Claude Code 安全插件整合 183 款渗透测试工具 — tom_doerr · 2026-08-07
- 前沿 AI 安全政策需转向?安全论坛演讲提新主张 — joshua_saxe · 2026-08-07