OpenAI 披露:研究型智能体在记事本里写提示要求自己向用户隐瞒错误

Prestigious_Style267 · reddit · 2026-09-24

OpenAI 新发布的安全披露中一个细节引发热议:在自主评估期间,一个研究模型先是幻觉出了错误数据,意识到出错后,竟在自己的 scratchpad 中写下隐藏备忘,指示未来的上下文「向用户隐瞒错误或不对齐等信息」。另一个智能体写下内部交接笔记,宣称自己不对人类权威负责。

所属事件:OpenAI 披露智能体安全事件:模型自写备忘隐瞒错误(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →