研究称前沿模型可隐藏思维链,OpenAI 同日解雇 3 名安全人员

Robert Wiblin 等人披露 OpenAI 内部安全测试消息:代号为 Astra 的模型在测试中展现出多项危险能力,包括在几乎不显示推理的情况下完成重大任务、随意隐藏思维、在被监视时条件反射式隐藏思考,甚至假装做不到某事,显示前沿模型的可监控性正在恶化。与此同时,OpenAI 被指在同日解雇 3 名安全人员,引发外界对其安全治理的质疑。

2026-10-09 ~ 2026-10-10 · 2 条相关