上海AI Lab发布SHE与SafeEvolve,Agent攻击成功率从17.1%降至5.5%

机器之心 · wechat · 2026-09-17

大模型 Agent 进入浏览器、邮件和业务系统后,传统只检查最终回复的安全评估已不足够——隐藏指令、工具权限过宽、错误记忆都可能让风险出现在执行任意环节。上海人工智能实验室联合复旦、上海交大、港科大和浙大提出 SHE 与 SafeEvolve 两项工作。

SHE:轨迹驱动的安全 Harness 演化

SafeEvolve:安全经验写入 Policy

两项工作推动 Agent 安全从静态一次性配置走向轨迹诊断、组件级责任划分、Harness 与 Policy 协同演进的持续系统能力。论文链接:SHE、SafeEvolve

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →