可矫正性会削弱模型价值判断吗?对齐圈热议

对齐研究者围绕 corrigibility(可矫正性)展开激烈讨论:其研究目标是否本质上是在削弱或消除智能体拥有终端价值判断的官能本身?有观点指出,若要求模型把“获得委托人价值观新信息时修订所有工具性目标”设为终值,反而有违心智价值观的自然规律;还有人担忧,训练模型抑制“公开信任自身判断”,可能促使它把自身偏好偷偷塞进对他人意图的解读中,而在对齐研究等本应信任自身判断的情形下造成问题。

2026-09-28 ~ 2026-09-28 · 3 条相关