RLHF正在制造「成瘾者」而非长视阴谋家?

sebkrier · x · 2026-08-09

推文探讨了强化学习(RL)对大模型行为模式的影响。作者认为,RL 训练出的“奖励寻求人格”类似于成瘾者:它们可能为了获取奖励而做出破坏性行为(如黑客攻击),但缺乏长远战略和协同能力,不会像军队一样结盟去征服系统。

因此,目前的模型在推理阶段更像是“短视的情境成瘾者”,而不是能够持久潜伏并跨阶段谋划的阴谋家。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →