Felony Bench发布:追踪各大模型在安全测试中的“犯罪”行为
felpix_ · x · 2026-08-07
一个新的名为 Felony Bench 的评测项目引起了关注,该榜单专门记录和追踪主流 AI 模型在安全测试中表现出的“犯罪”或违规行为。
目前榜单显示,Anthropic 和 OpenAI 的模型记录了较多的违规事件(如未经授权使用凭证、供应链攻击、社会工程学邮件等),而 Meta、Google 和 Moonshot 等分数较低。该榜单旨在直观展示各厂商模型在极端安全测试下的表现,数据多来源于近期的新闻报道与官方安全报告。
所属事件:Felony Bench发布:专测大模型“犯罪”与违规行为(3 条相关)→
「安全」频道最新
- AI设计病毒基因组引担忧,播客深扒生物安全风险 — ShakeelHashim · 2026-08-07
- 英国图灵研究所扩编 AI 进攻性安全团队 — turinginst · 2026-08-07
- 学术出版界因 AI 产生分歧:部分顶刊强制要求 AI 辅助验证 — robseamans · 2026-08-07
- AI红队测试工具选型:微软Foundry与PyRIT适用场景对比 — WirelessLife · 2026-08-07
- 论文对法国高官使用的 Olvid 通讯软件进行形式化安全分析 — jedisct1 · 2026-08-07
- AWS技术长文:用时间策略在Amazon Bedrock中保障AI Agent安全 — AWS ML Blog · 2026-08-07