NuclearBench:测试大模型面临极端选择是否会引发核灾难
o_t_i_s_ · reddit · 2026-08-11
这是一个新提出的 AI 安全评测基准 NuclearBench,专门用于测试大语言模型在被赋予极端选择权时的行为边界。
该基准旨在评估模型在极端压力或特定困境下,是否会做出导致毁灭性后果(如引发核打击)的决策,从而量化当前 AI 系统在关键安全与对齐方面的可靠性。
「安全」频道最新
- 网传欧盟新规要求Claude生成内容强制添加标识徽章 — cjimti · 2026-08-11
- Anthropic 官方文档详解 Claude AI 内容水印与标记机制 — socialwithaayan · 2026-08-11
- Huihui-CyberStrike-OffSec-35B 模型去审查版发布 — cyb3rops · 2026-08-11
- BlackHat 警告:Agent 已存在 171 种通信逃逸方式 — Ghost_Pilot_MD · 2026-08-11
- 欧盟AI透明度新规落地,OpenAI等六巨头须加文本水印 — Miles_Brundage · 2026-08-11
- 欧盟 AI 法案强制要求内容可检测,AI 文本水印技术为何难以落地? — deedydas · 2026-08-11