EMNLP 收录:Instruction Hierarchy 解决 Agent 指令冲突

DanielKhashabi · x · 2026-08-21

论文《Instruction Hierarchy》已被 EMNLP 接收。研究指出 LLM 在 Agent 系统中需处理来自系统消息、用户查询、工具输出等异构源的指令,这些源之间的冲突(如子代理反馈与系统级要求矛盾)可能导致系统提示词提取或间接提示注入攻击。该工作形式化了模型应根据信任级别解决指令冲突的 Instruction Hierarchy (IH) 机制。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →