RLHF 对 token 的影响分无意识与显性两层

社区探讨 RLHF 中模型生成 token 的变化机制,观点将影响分为三个层级:常用短语等连接基本不受奖励机制影响而保持原样;部分改变是无意识的,即 RL 改变了深层电路偏好;还有部分是模型显性的有意调整。进一步的讨论认为,所有模型的“心智运动”本质上都是由奖励预期的启发式算法或电路组成,即便某些看似稳定,也与推理奖励密切相关。

2026-09-01 ~ 2026-09-01 · 3 条相关