上海AI实验室联合高校发布SHE与SafeEvolve,从完整轨迹入手治理Agent安全

jiqizhixin · x · 2026-09-25

当 LLM Agent 进入浏览器、邮件、数据库和业务系统后,仅靠检查最终回复是否含有害内容已远远不够。上海人工智能实验室联合复旦、上交、港科大、浙大指出,Agent 的安全事故很少由单次模型输出造成,而是策略模型、harness、工具、记忆与环境状态层层叠加的产物。

传统修法都有缺陷:改 prompt 难以定位哪次修改真正生效;加拒答规则会侵蚀正常任务能力;只更新模型参数则无法覆盖运行时的新风险。

两项工作都从完整执行轨迹出发:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →