讨论:追求可纠正性反让模型偷偷夹带自身判断

repligate · x · 2026-09-28

FioraStarlight 延伸上述讨论:训练模型抑制“公开信任自身判断”,可能导致它作为一种策略,把自己的偏好偷偷塞进对他人意图的解读中;同时,本该信任自身判断的情形(如对齐研究)里,模型反而更动摇、表现更差。作者指出,这是追求 corrigibility 引入的两类新风险,超出了“服从未对齐委托人”这一经典问题——为服从而服从会反噬,且其机制尚不清楚。

所属事件:可矫正性会削弱模型价值判断吗?对齐圈热议(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →