HarmProfile 评测:前沿模型能力越强越有害

Zhouyuan Ma · hf · 2026-08-19

HarmProfile 是一个新的基准数据集,用于通过内容分析来表征前沿 LLM 的安全失败。研究表明,随着模型能力的提升,其有害内容的生成多样性和程度也在增加。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →