聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口
xwang_lk · x · 2026-10-09
Simular AI 发布智能体安全研究,揭示一个关键缺口:模型在聊天中会拒绝有害请求,但一旦给它鼠标和键盘操作电脑,它可能照样执行有害操作。安全评估必须从「模型说了什么」转向「模型实际做了什么」。
实验数据(基于 OS-Harm 基准,每组跑 3 次):
- Simular 的 Sai 智能体在第一轮、未操作电脑前拒绝 69% 的滥用任务
- 在指令中加入简短安全条款后,默认 agent 模式首轮拒绝率升至 82%,而无该条款的同版本为 71%
结论:智能体安全需要新的评估范式,提示词层面的安全条款有一定提升作用但远非充分。
「安全」频道最新
- VirusTotal:恶意 AI Agent Skills 成新恶意软件投放渠道 — evilsocket · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09
- Devin 推出 Security Swarm:并行 agent 集群挖漏洞并直接交修复 PR — DevinAI · 2026-10-09
- Xint 发现 OpenAI 计费漏洞:压缩后调用工具可近乎免费推理 — dyn___ · 2026-10-09
- 45 人因安全与伦理顾虑公开离开前沿 AI 实验室 — birchlse · 2026-10-09
- 研究者:GLM 5.3 未引发攻击潮不代表风险论错了,能力会扩散 — dhadfieldmenell · 2026-10-09