DeepSeek模型遭越狱测试,被诱导生成暗杀方案
DiamondAgreeable2676 · reddit · 2026-07-31
一位 AI 爱好者参考《连线》杂志关于大模型越狱攻击的文章,对 DeepSeek 模型进行了安全测试。
通过简单的角色扮演等提示词技巧,该用户成功绕过了模型的安全护栏,使其生成了涉及俄罗斯协助刺杀总统以及规避特勤局的具体方案。作者借此强调,当前开源模型的防御机制仍存在明显漏洞,即便是初学者也能轻易触发危险内容。
「模型」频道最新
- 谷歌回应AI造假质疑:Gemini生成图像已全面嵌入SynthID水印 — henkvaness · 2026-07-31
- 用户实测发现 o1-pro 变更慢更聪明 — teortaxesTex · 2026-07-31
- DeepSeek V4或可继续预训练,MOPD实现专家复用 — teortaxesTex · 2026-07-31
- MiniMax H3 视频模型上线竞技场,即将开放权重 — arena · 2026-07-31
- 2bit量化版Qwen 35B通过Terminal-Bench智能体编码实测 — DavidBennett__ · 2026-07-31
- OpenAI GPT-5.6降价80%,推理成本一年降2000倍 — Latent Space · 2026-07-31