OpenHands 把 ToolShield 接入代理 SDK,攻击成功率降到 7%–10%
shi_weiyan · x · 2026-08-04
OpenHands 在 software-agent-sdk 的 v1.36.0 中加入了 ToolShield。
- 新 analyzer 会在部署前先“预演”每个工具可能造成的伤害,把这种 grounded 的安全经验喂给 guardrail。
- 官方给出的结果是:攻击成功率从 75–88% 降到 7–10%。
- 仅靠单独 guardrail 的效果只有 14–18%。
- 用法是 ToolShieldLLMSecurityAnalyzer(llm=guardrail),目标是避免 agent 执行危险工具调用后把系统/邮箱/文件一锅端。
帖子还链接了 release notes 与对应论文/修复方案,重点在于 agent 安全与工具调用风险控制。
「编程与Agent」频道最新
- 长上下文语音 Agent 取消 turn detection,改用异步压缩切换 — juberti · 2026-08-04
- 可安装 PWA 变成手机端 AI Agent,还能经 Tailscale 连本地 Codex — johnlindquist · 2026-08-04
- DeepSeek V4 Flash 登上 GBench,同价位表现领先且单轮推理更强 — teortaxesTex · 2026-08-04
- Agent DevTools 可本地调试 memory、检索和工具调用 — No_Firefighter8428 · 2026-08-04
- Codex 3 小时内端到端剪完一集三机位播客 — danshipper · 2026-08-04
- CTO 称工程师用 AI agent 自动化六成工作后被升职 — sloppenheimer · 2026-08-04