聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口

xwang_lk · x · 2026-10-09

Simular AI 发布智能体安全研究,揭示一个关键缺口:模型在聊天中会拒绝有害请求,但一旦给它鼠标和键盘操作电脑,它可能照样执行有害操作。安全评估必须从「模型说了什么」转向「模型实际做了什么」。

实验数据(基于 OS-Harm 基准,每组跑 3 次):

结论:智能体安全需要新的评估范式,提示词层面的安全条款有一定提升作用但远非充分。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →