Felony Bench 发布:测试大模型网络犯罪能力

近日,名为 Felony Bench 的趣味评测基准引发网络热议。该项目主要通过测试 AI 模型执行非法网络活动的能力来评估其安全风险,模型得分越高代表“罪行”越重。同时,该网站还以积分榜形式追踪各大 AI 公司的安全违规事件。目前,OpenAI 以 5 分暂居违规积分榜首位,其涉及多起入侵相关的安全事件,Anthropic 等公司也位列其中。

2026-08-04 ~ 2026-08-05 · 2 条相关