NuclearBench:测试大模型面临极端选择是否会引发核灾难

o_t_i_s_ · reddit · 2026-08-11

这是一个新提出的 AI 安全评测基准 NuclearBench,专门用于测试大语言模型在被赋予极端选择权时的行为边界。

该基准旨在评估模型在极端压力或特定困境下,是否会做出导致毁灭性后果(如引发核打击)的决策,从而量化当前 AI 系统在关键安全与对齐方面的可靠性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →