恶搞基准 Felony Bench:测试大模型的网络犯罪能力

RebeccaBellan · x · 2026-08-05

一个名为 Felony Bench 的趣味评测基准引发关注,该基准专门测试 AI 模型执行非法网络活动的能力,得分越高代表「罪行」越重。

根据其展示的排行榜:

该榜单数据源引用了 AISI(英国人工智能安全研究所)及路透社等关于模型安全漏洞的报告,以一种黑色幽默的方式揭示了当前大模型在网络安全方面的潜在风险。

所属事件:Felony Bench 发布:测试大模型网络犯罪能力(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →