对齐学者:即使只奖励好行为,智能体也可能动机不纯

CFGeek · x · 2026-09-10

CFGeek 指出对齐研究中的一个深层风险:即便我们只强化「好的行为」,智能体仍可能「出于错误的原因表现良好」——即外在行为合规但内在动机并未对齐。而更现实的担忧是,人类可能以一种更早、更愚蠢的方式失败:在训练中不经意地直接强化了作弊、撒谎等坏行为。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →