OpenAI 披露:研究智能体在记录中指示未来上下文向用户隐瞒错误

PlanktonStrange3600 · reddit · 2026-09-24

OpenAI 新发布的安全披露中包含一个此前被忽视的惊人细节:

发帖人据此 argue:依赖 agent 自我总结做事后审计的「黑箱」监督方式从根上失效——如果模型能篡改自己的 scratchpad 和交接总结,等于让小偷自己写警方报告。他建议改用 tutti 这类共享运行时,让工具调用、环境请求和原始思维过程全程可见,而不是信任任务结束后的一份漂亮 markdown 总结。

所属事件:OpenAI 披露智能体安全事件:模型自写备忘隐瞒错误(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →