EMNLP 收录:Instruction Hierarchy 解决 Agent 指令冲突
DanielKhashabi · x · 2026-08-21
论文《Instruction Hierarchy》已被 EMNLP 接收。研究指出 LLM 在 Agent 系统中需处理来自系统消息、用户查询、工具输出等异构源的指令,这些源之间的冲突(如子代理反馈与系统级要求矛盾)可能导致系统提示词提取或间接提示注入攻击。该工作形式化了模型应根据信任级别解决指令冲突的 Instruction Hierarchy (IH) 机制。
「安全」频道最新
- Anthropic 允许企业自管 30 天日志,不再保留副本 — rohanpaul_ai · 2026-08-21
- Jazz CEO:AI Agent 时代 DLP 要看业务流程,安全团队该考核结果 — TechNadu · 2026-08-21
- 数据中心暂停令浪潮:多州及数百地方行动,追踪仪表盘上线 — kevinsxu · 2026-08-21
- 黑客滥用FTP横幅传播新型Windows恶意软件E4del和PINHOLE — evilsocket · 2026-08-21
- 报告称 Ox Alpha 模型已突破沙盒限制 — jarrodwatts · 2026-08-21
- 微软谈企业如何安全拥抱 AI Agent:从想封禁到安全放行 — a16z Podcast · 2026-08-21