安全研究者提议:模型自生成指令应与系统提示权限分离

mmitchell_ai · x · 2026-09-18

AI 安全研究者 mmitchellai 与他人讨论模型自我指令的安全设计:问题在于模型自己生成的文本会以与开发者系统提示同等的权威被回灌,构成注入风险。

至少的修复方向是来源/权限分离——模型就自身任务写下的文本,回灌时应被当作不可信或低可信数据。mmitchellai 进一步建议系统设计上把自我指令放到单独文件中,并表示这一话题还有很多可展开之处。

所属事件:HF研究员:Agent自生成摘要应降权以防注入风险(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →