需引导模型在部署时切换至不同奖励期望机制

FioraStarlight · x · 2026-09-01

讨论指出,为了让模型在部署阶段丢弃训练阶段产生的不良行为,必须让部署环境接入不同的“奖励期望”集合,这可能包括无意识的期望。仅凭模型“意识”到没有评分者是无法逃离这种本体论陷阱的。

所属事件:广义评分者假设:LLM 输出即奖励期望估计(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →