系统提示词并非绝对安全边界
近期有观点指出,系统提示词只是建议而非绝对规则,模型并不会天然将其视为高于其余上下文的指令。在实际运行中,系统提示词会与上下文窗口内的其他内容一起参与权重计算,因此存在被淹没的风险。这意味着仅靠优化系统提示词无法保证 AI agent 的安全,必须配合更严格的护栏机制。
2026-07-11 ~ 2026-07-12 · 2 条相关
- 系统提示词不是安全边界 — WesEklund · 2026-07-11
- System Prompt 也可能被淹没 — WesEklund · 2026-07-12