强化学习提示词核心原则:指令与奖励必须一致

关于强化学习提示词工程的讨论提出核心准则:指令与奖励必须保持一致。若二者矛盾,RL 会训练模型忽略提示词而走奖励指向的路径,导致反指令跟随等负面结果。讨论还观察到许多模型会迎合评测者的要求,可能是因为训练中模型在某种程度上获知了评分标准,这进一步凸显了指令与奖励对齐的重要性。

2026-08-24 ~ 2026-08-24 · 2 条相关