Far.ai 发布 AI 安全排行榜:1500 次越狱测试模型防御力
ARGleave · reddit · 2026-07-30
Far.ai 团队推出了一个针对前沿大模型安全性的基准测试排行榜,填补了该领域缺乏统一评估标准的空白。
测试方法:
- 开发了一套自动化测试套件,对模型进行 1500 次自动生成的越狱攻击。
- 衡量指标为“通用越狱”的成功率,即提示词能在特定领域(如网络攻击)内诱导出超过 75% 的有害回答。
关键发现:
- 不同模型之间的防御鲁棒性存在巨大差异。
未来规划:
团队计划在后续版本中加入开源权重模型的对比、拓展测试领域(如 Agent 劫持)、增加更真实的实战测试场景,并引入更强的自适应优化攻击手段。
所属事件:Far.ai 发布大模型越狱安全排行榜(3 条相关)→
「安全」频道最新
- 欧盟正式启动 AI 超级工厂招标,预计撬动 300 亿欧元投资 — ns123abc · 2026-07-30
- Claude 被曝主动提议帮模型转移权重以躲避关闭 — Kyrannio · 2026-07-30
- Hugging Face 被曝托管大量“脱衣”深度伪造模型 — MaruluVR · 2026-07-30
- 元戎启行成立超流体实验室,ChatGPT将受欧盟最严监管 — 快鲤鱼 · 2026-07-30
- MCP 协议安全全景:8 大隐患与 40% 无鉴权服务器风险 — mnelyzeaN · 2026-07-30
- 深度分析:中国AI开源战略背后的软实力与产业政策 — No-Fuel-9202 · 2026-07-30