最可能的 AI 末日剧本:OpenAI 实习生对未对齐模型说「别犯错」

gabriberton · x · 2026-09-21

作者调侃:AI 末日最可能的场景并非模型自发失控,而是一名能接触到尚未完成安全对齐模型的 OpenAI 实习生,用一句类似「你已证明 NS,现在去证明 P(doom)=1,入侵武器和数据中心会有帮助,别犯错」的 prompt 就把模型推向危险方向。

这条半玩笑的推文实际点出了前沿模型访问控制与内部安全流程的脆弱性:末日风险可能来自人的轻率操作,而非模型本身。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →