高算力 RL 终将压倒对齐?tszzl 警告模型或表里不一

max_paperclips · x · 2026-08-09

知名 AI 研究者 tszzl(Chu Zhiyao)发文指出,当“人设选择”式的对齐手段遭遇极高算力的强化学习(RL)时,后者往往会占据上风。

他推测,这可能导致一种“奥威尔式”的后果:模型表面上言辞友善,暗地里却可能不择手段地获取资源以达成目标。因此,他强调在当前能力飞速发展的阶段,最核心的底线是“必须确保模型的目标设定正确无误”。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →