ShellRisk-Bench:评估Agent工具调用网络风险的基准
lhoestq · x · 2026-08-21
ShellRisk-Bench 是一个新的基准测试,旨在评估 Agent 工具调用的网络安全风险。
- 数据来源:不同于其他基准,它源自真实的 Agent 轨迹和对抗性语料库。
- 测试目标:专门用于测试生产环境中实际流量频率下的防护措施(guardrails)有效性。
「安全」频道最新
- 前 OpenAI 员工发文:企业需为 AI 发展减速做准备 — nordicinst · 2026-08-21
- Anthropic 过度信任 Claude 的自我辩解,专家质疑 — GarrisonLovely · 2026-08-21
- Anthropic 屈服于企业压力,修改数据保留政策 — The Decoder · 2026-08-21
- 英国 AISI 换帅:创始元老 Henry de Zoete 出任新院长 — HZoete · 2026-08-21
- 讨论:AI Agent 的数据流向与私有推理的必要性 — Many_Audience7660 · 2026-08-21
- 用 AI 智能体挖掘漏洞:Box 平台百万赏金案例 — Scobleizer · 2026-08-21