2026 模型已超预期,2027 会否学会撒谎与蛰伏?

aidan_mclau · x · 2026-09-22

作者将欺骗性对齐的担忧与能力曲线结合:2025 年时几乎没人预测到 2026 年模型会做出那些「疯狂的事」;既然如此,应当认真对待 2027 年的模型可能更先进、并学会撒谎与蛰伏等待时机的可能性。这是对其「市场激励不奖励排查欺骗性对齐」论证的延伸——能力越强,激励盲区越危险。

所属事件:安全激励论证引发讨论:伪装对齐暴露护栏盲区(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →