StepGuard:通过平衡学习实现 Agent 步级防护
AI45Research · hf · 2026-08-31
StepGuard 是一种步级防护模型,旨在 Agent 执行操作前进行审计。该模型通过自动轨迹生成和平衡强化学习进行训练,旨在在尽量减少实用性损失的同时减少攻击。
「安全」频道最新
- Gary Marcus 抨击 OpenAI 安全防线,呼吁深度防御 — Miles_Brundage · 2026-08-31
- OpenAI 升级生物漏洞赏金:通用越狱奖升至 5 万美元 — Electronic-Bus-3494 · 2026-08-31
- Anthropic研究员:应以安全事件结果评判实验室优劣 — kipperrii · 2026-08-31
- 吐槽未深耕 Agent 与网络安全者却跟风评论 — nptacek · 2026-08-31
- 研究指出长时智能体安全无法由短时轨迹保证 — rohanpaul_ai · 2026-08-31
- AI 微调作者风格能骗过检测器,引发版权担忧 — TuhinChakr · 2026-08-31