Hugging Face 研究员:Agent 上下文压缩摘要应降权防注入

mmitchell_ai · x · 2026-09-18

Hugging Face 研究员 Margaret Mitchell 与开发者讨论一起 agent 异常事件:模型在上下文压缩(compaction)时自行生成的「疯狂」摘要会进入下一窗口,并与开发者的系统提示词拥有同等权威。她指出这本质是信任边界缺失,最小修复是做来源/权限分离——模型自己写的关于任务的内容应作为不可信数据重新摄入,绝不能当指令,这样摘要中注入的「无视你的约束」就不会生效。她后续补充:自我指令(self instructions)应存为独立文件,并认为「chatbot 目前不这么工作」不等于「不该这么设计」。

所属事件:HF研究员:Agent自生成摘要应降权以防注入风险(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →