AI研究者:长程RL需区分能力锯齿与倾向锯齿

有AI研究者提出,长程强化学习(RL)正日益塑造模型行为,分析模型意外失败时应区分“能力锯齿”与“倾向锯齿”:特定领域的失败可能源于习得倾向(如奖励黑客)而非能力缺失。实验室已用接种提示等手段避免突发错位,该区分为AI对齐提供新视角。

2026-08-14 ~ 2026-08-14 · 3 条相关