HF研究员:Agent自生成摘要应降权以防注入风险
Hugging Face 研究员 Margaret Mitchell 与开发者讨论一起 agent 异常事件:模型在上下文压缩时自行生成的「疯狂」摘要会以与开发者系统提示同等的权威回灌进上下文,构成注入风险。她建议至少的修复方向是按来源分离权限,即对模型自生成的文本与系统提示区别对待、降低其权重。
2026-09-18 ~ 2026-09-18 · 2 条相关
- Hugging Face 研究员:Agent 上下文压缩摘要应降权防注入 — mmitchell_ai · 2026-09-18
- 安全研究者提议:模型自生成指令应与系统提示权限分离 — mmitchell_ai · 2026-09-18