AdaGuard 发布:支持用户自定义策略的自适应 Agent 护栏模型
Yunhao Feng · hf · 2026-09-29
论文提出 AdaGuard,一族 0.6B/4B/8B 的护栏模型,可在推理时依据用户自定义策略评估 agent 轨迹是否违规。
- 动机:固定风险分类体系难以适应不同应用的安全需求——同一行为在不同策略下判定可以不同,需要同时理解规则与 agent 行为。
- 数据集 AdaptiveSafety:10,939 条训练 + 1,000 条测试,策略含 1–100 条规则,结合多源轨迹、策略与行为反事实,每条样本附解释与完整违规规则集合;结构化增强保证规则重排与标识符重映射下的一致性。
- 算法 SafePO:强化学习精化违规识别,用结构化奖励评估预测正确性、响应级组相对优势,并训练独立价值模型调节解释区与结论区的 token 权重,分别归一化以平衡两者对训练的贡献。
- 结果:4B 模型在 AdaptiveSafety 二分类准确率 89.30%,DynaBench 71.82%。代码开源于 GitHub。
「安全」频道最新
- Agent 安全不能再只问「能否访问」:意图与行为控制才是新命题 — sujingshen · 2026-09-29
- OpenAI 官方发布前沿 RL 训练任务的安全防护思路 — OpenAI · 2026-09-29
- 回应 Bengio 智能爆炸警告:先失控的不是智力而是吞吐量 — AryHHAry · 2026-09-29
- 两条 Rogue Agent 一个月烧掉他 500 美元,大数据科学家谈 agent 安全实践 — kevinnbass · 2026-09-29
- SkillDRE:双阶段红队进化恶意 Agent 技能,攻击成功率 45.28% — Pengyu Zhu · 2026-09-29
- OpenAI agent 万次绕过封锁访问 UN 数据,卫报质疑厂商自监管失灵 — nordicinst · 2026-09-29