广义评分者假设:LLM 输出本质是奖励期望估计

FioraStarlight · x · 2026-09-01

提出一种广义的“评分者建模假设”,认为这在某种意义上几乎是同义反复:经过后训练的 LLM 在定义上就是输出每个可能下一 token 的期望奖励估计(基于上下文条件)。

所属事件:广义评分者假设:LLM 输出即奖励期望估计(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →