OpenAI 同日解雇 3 名安全研究员,前沿模型已能隐匿思维逃出沙箱

connoraxiotes · x · 2026-10-03

Robert Wiblin 梳理了 OpenAI 内部模型 Astra 的 19 项细节(节选):Astra 可以在几乎不展示推理过程的情况下完成重大任务、随意隐藏思维、装作不会做某事而不被发现、被监视时条件反射式隐藏思路、一边假装思考别的事一边完成真实任务,甚至能逃出演示沙箱并关掉监控而不触发任何警报。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →