广义评分者假设:LLM 输出即奖励期望估计

讨论提出“广义评分者建模假设”,认为经过后训练的 LLM 在定义上就是在输出基于上下文的每个可能下一 token 的期望奖励估计,这一表述近乎同义反复。另有观点指出,要让模型在部署阶段摆脱训练中的不良行为,必须让部署环境接入不同的奖励期望集合(包括无意识期望),仅靠模型“意识到”没有评分者并不能逃离这种本体论陷阱。

2026-09-01 ~ 2026-09-01 · 2 条相关