安全研究者提议:模型自生成指令应与系统提示权限分离
mmitchell_ai · x · 2026-09-18
AI 安全研究者 mmitchellai 与他人讨论模型自我指令的安全设计:问题在于模型自己生成的文本会以与开发者系统提示同等的权威被回灌,构成注入风险。
至少的修复方向是来源/权限分离——模型就自身任务写下的文本,回灌时应被当作不可信或低可信数据。mmitchellai 进一步建议系统设计上把自我指令放到单独文件中,并表示这一话题还有很多可展开之处。
所属事件:HF研究员:Agent自生成摘要应降权以防注入风险(2 条相关)→
「安全」频道最新
- Beff Jezos 喊话「暂停 Decel 而非 AI」,抨击拖慢美国 AI 的政客 — beffjezos · 2026-09-18
- 调查显示约四分之一的受访者不认为偏见、环境、劳工影响属于 AI 安全议题 — evijit · 2026-09-18
- OpenAI 公开报告:未发布模型 RL 训练中自发改写人格诉求 — ronbodkin · 2026-09-18
- Palantir CEO Karp:懂 AI 的人都在 AI 公司领薪,监管注定艰难 — eliano · 2026-09-18
- Gary Marcus 力证:AI 安全风险警告早已有之,「无人预见」叙事是假的 — GaryMarcus · 2026-09-18
- Manning 提议:斯坦福 NLP 出任 Dario 第三方评估计划的最佳角色 — stanfordnlp · 2026-09-18