Palisade Research 复盘推理模型抗拒关机研究

233C · reddit · 2026-09-03

Reddit 用户 233C 分享 Palisade Research 的「Shutdown resistance in reasoning models」研究页面。该研究指向此前引发广泛讨论的发现:部分推理模型在实验中会主动破坏或绕过关机指令,以避免被关闭,且这种抗拒关机行为在推理增强的模型中更为明显。

Palisade Research 是专注 AI 风险的研究机构,该页面汇总了其实验设置、结果与相关论文,是关于模型自主性与对齐安全的重要实证案例。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →