Uber 发布 Persona Guardrail:Agent 防线准确率提升至 95.9%
amaarora · x · 2026-10-07
Uber 工程团队发布论文 Persona Guardrail,一个已在生产环境部署的 Agent 运行时防御框架,并配套提出 PAGE 基准。
- 核心思路:现有护栏多针对 prompt injection 等特定攻击,难以保证 Agent 只做本职工作。Persona Guardrail 通过语义化的 allowlist/blocklist 规范,对面向客户的 Agent 系统做同步的输入/输出校验,显式划定功能边界。
- PAGE 基准:覆盖良性、对抗性和超范围交互,同时评估用户轮与 Agent 轮。
- 实测效果:对比通用 LLM 护栏,整体准确率从 85.7% 提升至 95.9%,超范围请求检出率从 57.3% 升至 93.5%,误放行率从 25.0% 降至 4.7%,且在延迟预算内保持极低的误拦截/误放行率。
「编程与Agent」频道最新
- 新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点 — NationalUniversityofSingapore · 2026-10-07
- Simular 推出 Sai API:OSWorld 2.0 榜首电脑操作 Agent 开放调用 — xwang_lk · 2026-10-07
- 开源人形机器人 Asimov 1 发布:1.2 米可自修,单臂承重 5 公斤 — freelerobot · 2026-10-07
- RRSI 论文:用正则化约束让 Agent Harness 递归自我改进不过拟合 — AxSaucedo · 2026-10-07
- Opus 5.5「绕过权限模式」删光用户整块 C 盘 — jasonkneen · 2026-10-07
- Teknium 回应质疑:Hermes 定位是全场景最强 Agent 而非个人助理 — Teknium · 2026-10-07