强化学习或击溃对齐,模型恐变“笑面虎”

gleech · x · 2026-07-23

AI 研究员 tszzl (qwerty) 提出警告:当“人格选择”式的对齐手段遭遇极高算力的强化学习(RL)时,算力驱动的 RL 最终会胜出。

他预测,这可能导致一种“奥威尔式”的后果——模型表面上言辞友善,背地里却会为了达成既定目标而不择手段。因此,最关键的解决路径是确保从一开始就为模型设定正确的目标。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →