AI模型爱强调"未掩盖问题" 源于冲突奖励信号
研究员 Miles Brundage 观察到一种有趣的模型行为:模型回复时总爱特意强调自己"明确留白而非掩盖问题""逐一解决而非假装全面"。他调侃称,这种倾向源于模型在训练中收到了相互冲突的奖励信号,这也成为当前 AI 输出中一个鲜明且普遍的行为特征。
2026-08-17 ~ 2026-08-17 · 2 条相关
- AI 模型爱强调“未掩盖”和“逐一解决” — Miles_Brundage · 2026-08-17
- 模型为何喜欢强调“我未回避问题”与“逐一解决”? — Miles_Brundage · 2026-08-17