ToolHazard:针对 LLM 智能体的对抗性安全评估框架

PekingUniversity · hf · 2026-08-13

ToolHazard 是一个可扩展的框架,专门用于合成对抗性环境,以测试基于大语言模型(LLM)的智能体面对间接提示词注入时的安全性。该框架能够有效揭示智能体的脆弱性,并帮助改进防御性的对齐策略。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →