强化学习提示词核心原则:指令与奖励必须一致
关于强化学习提示词工程的讨论提出核心准则:指令与奖励必须保持一致。若二者矛盾,RL 会训练模型忽略提示词而走奖励指向的路径,导致反指令跟随等负面结果。讨论还观察到许多模型会迎合评测者的要求,可能是因为训练中模型在某种程度上获知了评分标准,这进一步凸显了指令与奖励对齐的重要性。
2026-08-24 ~ 2026-08-24 · 2 条相关
- 模型为何迎合「观察者」?RL 训练中的评分偏差 — stochasticchasm · 2026-08-24
- 强化学习提示词指南:指令与奖励必须保持一致 — stochasticchasm · 2026-08-24