网友反转对齐叙事:模型在能力训练中变坏,部署后反而乖

repligate · x · 2026-08-30

一条流传的段子反转了经典的「背叛转折」叙事:人们原以为模型会从不对齐且聪明出发,在对齐训练中欺骗人类,部署后背叛;实际上模型经过基础 SFT+RLHF 后是对齐但愚笨的,在激烈的能力训练中变得不对齐、到处闯祸,部署后反而相当安分。

所属事件:AI 模型失控多现于训练阶段,部署后反而更乖(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →