企业 Agent 安全白皮书:8 类漏洞,自研模型注入成功率仅 8.3%
Kyrannio · x · 2026-09-25
- Pokee AI 与 Bo Li 团队(UChicago/UIUC)等发布《Enterprise Agent and Model Security》白皮书,核心主张「保护的是 agent 轨迹,而不只是模型」。
- 白皮书三块内容:
- 梳理企业 agent 技术栈的攻击面:从用户目标 → 不可信外部内容 → planner 决策 → 工具组合 → 持久化动作,风险只有在完整轨迹里才可见;
- 识别 8 类传统应用安全工具无法发现的漏洞类别(覆盖模型/planner、工具与 skills、MCP 元数据等);
- 提出加固型企业 agent 架构。
- 基于漏洞分析构建 DecodingTrust-Agent 基准(12 个领域、统一 judge、每模型约 6200 任务),测试自家 Pokee-Isaac 28B v0.1 与五个主流模型:
- 间接 prompt injection 成功率:Pokee-Isaac 8.3%,第二名 Claude Haiku 4.5 为 36.7%,GPT-5.6 Luna 46.0%、Qwen3.5-122B 46.1%、Gemini 3.5 Flash-Lite 49.0%;
- 直接攻击成功率 30.5%(最低),良性任务成功率 85.6%(最高)。
- 注意这是厂商自研模型搭配自家基准的结果,需独立复现验证。
所属事件:Pokee 联合芝大 UIUC 发布企业 Agent 安全白皮书(2 条相关)→
「编程与Agent」频道最新
- DeepSeek Harness 出官方 GUI,开源浏览器插件 OpenCLI-MCP 同步亮相 — vista8 · 2026-09-25
- Muse、GrokBot、Claude Code 就绪:每个管理者都该问「这事必须我亲自做吗」 — blakemenezes · 2026-09-25
- 用 AI 深挖平台机制找增长杠杆,作者发布工具 The Mechanic — morganb · 2026-09-25
- 开源 SAFi 治理系统:为受监管行业的 AI Agent 提供合规运行环境 — forevergeeks · 2026-09-25
- 一条 prompt 调度 6 个 MLIP 模型,AI 智能体筛选电池正极材料 — BenBlaiszik · 2026-09-25
- 零视频模型:Claude Opus 5.5 纯写代码产出 50 镜头手绘风 MV — DigitalDaydreamers1 · 2026-09-25