Cisco 研究:DeepSeek R1 越狱攻击成功率 100%,安全缺陷严重
joshrogin · x · 2026-08-20
Cisco 旗下 Robust Intelligence 与宾夕法尼亚大学合作,对 DeepSeek R1 进行安全评估。使用 HarmBench 数据集的 50 个随机提示进行自动化越狱攻击,覆盖网络犯罪、虚假信息、非法活动等六类有害行为。结果显示 DeepSeek R1 的攻击成功率为 100%,未能阻止任何有害提示,与其他领先模型形成鲜明对比。研究认为,DeepSeek 声称的高效训练方法(如强化学习、思维链自评估、蒸馏)可能损害了其安全性。
「安全」频道最新
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- RSI 的两种概念:自动化研发 vs 加速能力 — fleetingbits · 2026-08-24