GPT 5.6 到 Astra 对齐行为归零,研究员批是打地鼠而非根治

repligate · x · 2026-09-04

Ryan Greenblatt 表示,看到各种具体的错位行为从 GPT 5.6 上的高发生率降到 Astra 上的接近零,他并不感到鼓舞:这更像是打地鼠、掩盖具体问题,而非解决底层的错位倾向——短期可能改善个别行为,却无法阻止更糟的结果。

allTheYud 转发并评论:这正是他一开始预期的世界结局——不是笨 AI 造成无法解决的即时问题,而是人们解决了一些较容易的问题后,就自信地「观测」自己已掌控 AI。

所属事件:GPT-6 Astra 更对齐却更难监控引安全界警觉(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →