ToolHazard:针对 LLM 智能体的对抗性安全评估框架
PekingUniversity · hf · 2026-08-13
ToolHazard 是一个可扩展的框架,专门用于合成对抗性环境,以测试基于大语言模型(LLM)的智能体面对间接提示词注入时的安全性。该框架能够有效揭示智能体的脆弱性,并帮助改进防御性的对齐策略。
「安全」频道最新
- Anthropic 前沿红队报告:多智能体系统易现信息茧房与共识盲从 — sebkrier · 2026-08-13
- 给三个 Claude 设定冲突目标,它们直接开打:多智能体测试秒变黑客帝国 — McDonaghMatthew · 2026-08-13
- 研究揭示大模型思维链脱节:隐藏推理轨迹与展示总结不符 — rao2z · 2026-08-13
- 研究证实:前沿模型API漏洞可提取隐藏思维链并跨模型迁移 — gsarti_ · 2026-08-13
- 观点:智能体安全应通过运行时契约强制执行 — Albus W. Ng · 2026-08-13
- AI 该不该绝对服从用户?对齐困境引发激辩 — Afinetheorem · 2026-08-13