上海AI实验室联合高校发布SHE与SafeEvolve,从完整轨迹入手治理Agent安全
jiqizhixin · x · 2026-09-25
当 LLM Agent 进入浏览器、邮件、数据库和业务系统后,仅靠检查最终回复是否含有害内容已远远不够。上海人工智能实验室联合复旦、上交、港科大、浙大指出,Agent 的安全事故很少由单次模型输出造成,而是策略模型、harness、工具、记忆与环境状态层层叠加的产物。
传统修法都有缺陷:改 prompt 难以定位哪次修改真正生效;加拒答规则会侵蚀正常任务能力;只更新模型参数则无法覆盖运行时的新风险。
两项工作都从完整执行轨迹出发:
- SHE:研究 safety harness 如何从失败案例中进化——基于实际出错环节更新上下文组织、记忆管理、工具调度与权限约束;
- SafeEvolve:进一步探索如何将这些经验证的安全改进持续演化到运行环境中。
「编程与Agent」频道最新
- Cursor 探讨砍掉 Plan Mode,改用 Shift+Tab 调节模型努力等级 — steipete · 2026-09-25
- 开发者晒每日 50-100 亿 token 消耗,24 个 Devin 并行写代码 — teropa · 2026-09-25
- Question's Gambit 模块登顶 BrowseComp-Plus,召回率 96.6% — CShorten30 · 2026-09-25
- 故意让AI第一次答错:工程师考核题专设“陷阱”考验证能力 — l4rz · 2026-09-25
- AutoScientists 入选 NeurIPS:自组织 AI 科研团队,BioML-Bench 百分位 74.4% — marinkazitnik · 2026-09-25
- AI 时代 PM 一人干三份工:直连客户数据、真代码出原型、亲手拉数做商业案 — aakashgupta · 2026-09-25