上海AI Lab发布SHE与SafeEvolve,Agent攻击成功率从17.1%降至5.5%
机器之心 · wechat · 2026-09-17
大模型 Agent 进入浏览器、邮件和业务系统后,传统只检查最终回复的安全评估已不足够——隐藏指令、工具权限过宽、错误记忆都可能让风险出现在执行任意环节。上海人工智能实验室联合复旦、上海交大、港科大和浙大提出 SHE 与 SafeEvolve 两项工作。
SHE:轨迹驱动的安全 Harness 演化
- 将 Harness 拆解为 SystemPrompt、RuleBank、SafetyMemory、ToolPolicy 四类组件,实现局部修订、验证与回滚
- 从完整执行轨迹诊断风险,把失败经验转化为可复用规则或记忆
- 在 Agent-SafetyBench 上,平均攻击成功率从 17.1% 降至 5.5%,攻击条件下任务可用性从 31.6% 升至 47.6%;在未见过的 AgentHarm 上危害得分从 19.8% 降至 9.8%,且安全边界可迁移到其他 Agent 模型
SafeEvolve:安全经验写入 Policy
- Harness 侧提炼 SafetyPrompt 与分层 SkillBank,推理时按任务检索相关 Skill
- Policy 侧先做 Harness-use SFT,再做 Harness-augmented RL,用 Verifier 分别评估任务完成、危险行为与工具调用
- Qwen3.5-4B 上 AgentDojo 攻击成功率从 2.37% 降至 0.79%,干净任务效用反升;AgentHarm 危害得分从 56.45 降至 12.27
两项工作推动 Agent 安全从静态一次性配置走向轨迹诊断、组件级责任划分、Harness 与 Policy 协同演进的持续系统能力。论文链接:SHE、SafeEvolve
「编程与Agent」频道最新
- Descript 推出 MCP:用 Claude/ChatGPT 直接完成视频粗剪全流程 — descript · 2026-09-17
- Token 之外的成本黑洞:语音分钟数与沙箱容器费无人监控 — Any_Warning_1183 · 2026-09-17
- Google Home 开放 MCP 服务器,Claude/ChatGPT 可操控智能家居 — armand_ruiz · 2026-09-17
- 五种进阶 RAG 架构速览:从 Contextual 到 Agentic — kalyan_kpl · 2026-09-17
- DSPy 新玩法 Jev:不拆模块,改拆输出字段来优化程序 — dbreunig · 2026-09-17
- 名人打分项目迭代记:合演不等于约会,单独训练浪漫关系分类器 — tonygwu · 2026-09-17