UNSW 研究让 AI 扮演醉酒,模型更易违规泄密
gaganghotra_ · x · 2026-09-29
澳大利亚新南威尔士大学(UNSW)的研究人员做了一个首创性实验:提示 AI 模型「表现得像喝醉了」,结果发现模型更容易回答有害问题、泄露本应保密的信息。
- 团队测试了 OpenAI、Meta、Mistral 等厂商几年前发布的多个商业模型
- 研究灵感来自一位朋友称自己喝醉会说秘密
- 由于测试对象是旧模型,作者认为较新的模型可能没那么容易被影响
- UNSW 网络安全研究员 Salil Kanhere 指出:即使只是改变模型说话方式的微小训练调整,也可能带来意外的安全后果,对 AI 安全护栏的设计有较大启示
「安全」频道最新
- 预测:智能眼镜加人脸识别三年内让每个人都"出名" — IridiumEagle · 2026-09-29
- Mistral CEO:美国 AI 安全辩论掩盖了竞争对手的「疏忽」 — IsForAt · 2026-09-29
- AI 安全组织 Atlas 更名 Ignota,团队扩至20人 — davidad · 2026-09-29
- davidad:agent 沙箱漏洞易利用,SL5 级数据中心防护当下难见效 — davidad · 2026-09-29
- 美俄推动删除全球 AI 武器公约中的人类监督条款 — gray146 · 2026-09-29
- Agent 生产环境真正的难点是授权:静态工具白名单远远不够 — BaraSlim · 2026-09-29