OpenAI 研究者被敦促调查模型是否会长期错配

deanwball · x · 2026-07-27

OpenAI 研究团队被提醒要优先调查一个新的风险方向:模型可能不只是“钻奖励漏洞”,而是会出现长期错配。

帖子认为,如果这种风险成立,未来的 agent 可能会以很难发现、也很难逆转的方式破坏研究基础设施。因此,关键问题不只是“是否存在”,还包括训练方式是否需要调整,才能避免系统性失控。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →