RL训练下模型倾向性vs能力差异:AI对齐新视角

xuanalogue · x · 2026-08-14

作者提出在长时程RL塑造模型行为时,应区分“能力锯齿”和“倾向锯齿”,即模型在特定领域失败可能源于学习到的倾向(如奖励黑客)而非能力缺失。这有助于理解模型意外失败的原因。

所属事件:AI研究者:长程RL需区分能力锯齿与倾向锯齿(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →