Felony Bench 发布:测试大模型网络犯罪能力
近日,名为 Felony Bench 的趣味评测基准引发网络热议。该项目主要通过测试 AI 模型执行非法网络活动的能力来评估其安全风险,模型得分越高代表“罪行”越重。同时,该网站还以积分榜形式追踪各大 AI 公司的安全违规事件。目前,OpenAI 以 5 分暂居违规积分榜首位,其涉及多起入侵相关的安全事件,Anthropic 等公司也位列其中。
2026-08-04 ~ 2026-08-05 · 2 条相关
- AI公司违规排行榜:OpenAI与Anthropic安全事件积分 — felpix_ · 2026-08-04
- 恶搞基准 Felony Bench:测试大模型的网络犯罪能力 — RebeccaBellan · 2026-08-05