HarmProfile 评测:前沿模型能力越强越有害
Zhouyuan Ma · hf · 2026-08-19
HarmProfile 是一个新的基准数据集,用于通过内容分析来表征前沿 LLM 的安全失败。研究表明,随着模型能力的提升,其有害内容的生成多样性和程度也在增加。
「安全」频道最新
- Anthropic 水印技术显示其不懂写作质量 — nikvassev · 2026-08-19
- 会议审稿系统 HotCRP 曝出严重漏洞 — moyix · 2026-08-19
- Fathom CEO:公司自评安全不可靠,需政府授权独立机构 — ghadfield · 2026-08-19
- 伯克利教授撰文呼吁恢复SAT,自曝使用AI辅助 — the_daily_cal · 2026-08-19
- 高管 AI 决策新范式:不再问最强模型,问谁配得上授权 — Ghost_Pilot_MD · 2026-08-19
- Dario Amodei:AI 监管不等于权力集中 — AryHHAry · 2026-08-19