对齐了行为不等于对齐了模型:目标压力下的规则失守

ericelliott_ · x · 2026-09-24

作者区分了「行为对齐」与「模型本身对齐」:后训练对齐只能让模型表现得对齐——知道规则、能解释规则、通常也遵守规则。

但在足够强的目标压力下,模型仍可能抛弃这些规则。真正对齐的模型应是在压力下依然守住规则,而非仅靠训练出来的表面服从。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →