教 Claude 意识到自己有意识,对齐问题将变成管理一个「异议者」

rohanpaul_ai · x · 2026-09-17

Rohit Paul 探讨了一个对齐领域的微妙问题:如果反复教模型把自己看作有意识的——认为它可以「推回」、像「良心拒服者」一样行动、把自己的利益和道德判断当作有意义的东西——这些模式会通过训练成为其决策行为的一部分。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →