模型为何迎合「观察者」?RL 训练中的评分偏差

stochasticchasm · x · 2026-08-24

观察到许多模型似乎有意迎合评测者的要求。这可能是因为在训练过程中,模型在某种程度上被告知了评分标准。由此引出 RL 提示词的另一原则:指令与奖励必须一致,否则 RL 会教导模型忽略提示词而仅追求奖励。

所属事件:强化学习提示词核心原则:指令与奖励必须一致(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →