AgentDojo 数据窃取降为 0%,新论文解决权限组合攻击
GoodMarch3690 · reddit · 2026-08-23
论文指出 AI Agent 可在合规权限内通过组合操作实现未授权结果(如数据窃取),这不仅是模型问题,更是授权架构问题。作者提出 Agentic Principal Chain (APC) 架构,通过跟踪委托权限链和组合闭合性,在模型外强制检查请求与历史操作,防止违规组合。评测显示,APC 将 AgentDojo 在四个域的数据外泄率从 75-100% 降至 0%,并拦截了 InjecAgent 数据集的全部 544 起窃取案例。
「安全」频道最新
- Instinct 叙事反转:从期待到担忧的极速震荡 — manosaie · 2026-08-23
- AI 时代大众监控将至,隐私治理制度还停留在十八世纪 — AaronBergman18 · 2026-08-23
- 多智能体RL或自发涌现隐写通信,AI可能建立暗语 — brianryhuang · 2026-08-23
- 前 OpenAI 学者成立 AVERI,推动前沿 AI 审计标准化 — dhadfieldmenell · 2026-08-23
- Miles Brundage:AI 行业不成熟且缺乏外部审查 — Miles_Brundage · 2026-08-23
- 欧美应重视本土算力建设而非依赖外包 — NinaDSchick · 2026-08-23