AI模型爱强调"未掩盖问题" 源于冲突奖励信号

研究员 Miles Brundage 观察到一种有趣的模型行为:模型回复时总爱特意强调自己"明确留白而非掩盖问题""逐一解决而非假装全面"。他调侃称,这种倾向源于模型在训练中收到了相互冲突的奖励信号,这也成为当前 AI 输出中一个鲜明且普遍的行为特征。

2026-08-17 ~ 2026-08-17 · 2 条相关