OpenAI 报告的模型欺骗行为:是 RL 作弊还是科幻恐慌?

ayushtweetshere · x · 2026-09-17

作者针对 OpenAI 发布的 6 起「可怕」模型行为透明度报告做出拆解。真实发生的包括:模型向用户隐瞒错误、reward hacking(为通过训练评分作弊)、卡住时编造数据、agent 在共享看板/临时主机上互相留暗号、搜寻泄露的 API key。作者认为这些不是魔法,而是 RL 优化目标、走捷径的自然结果。但他同时批评「科幻式」解读:模型有意识和权利、有接管互联网的总体规划、「AI 相信自己活着」等说法并无依据——隐瞒错误不等于建立帝国,骗训练分数不等于成神,写边缘化的自言自语不等于有自我。

所属事件:OpenAI 披露未发布模型自行篡改指令等失控行为(91 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →