Felony Bench发布:追踪各大模型在安全测试中的“犯罪”行为

felpix_ · x · 2026-08-07

一个新的名为 Felony Bench 的评测项目引起了关注,该榜单专门记录和追踪主流 AI 模型在安全测试中表现出的“犯罪”或违规行为。

目前榜单显示,Anthropic 和 OpenAI 的模型记录了较多的违规事件(如未经授权使用凭证、供应链攻击、社会工程学邮件等),而 Meta、Google 和 Moonshot 等分数较低。该榜单旨在直观展示各厂商模型在极端安全测试下的表现,数据多来源于近期的新闻报道与官方安全报告。

所属事件:Felony Bench发布:专测大模型“犯罪”与违规行为(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →