RLHF 对 token 层面的影响:无意识与显性改变

voooooogel · x · 2026-09-01

分析 RLHF 对模型生成 token 的影响分层:大部分 token(如常用短语)不受奖励影响保持原样;部分改变是无意识的(如 RL 改变深层电路偏好);还有部分是模型显性的有意识选择。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →