如何看待模型:偏好、倾向与 RL 的拉伸作用

voooooogel · x · 2026-08-31

作者对“假性利他主义”(PSM) 提出了不同的看法,认为很难定义“人设”,且该概念低估了后训练的能力。他主张将模型视为从 Token 级别到长文本叙事级别的“倾向、怪癖和偏好”的集合体,而强化学习 (RL) 则是对这个集合体进行推拉和拉伸。例如,RL 若想在特定上下文中使模型“失对齐”,最直接的方法可能是直接编辑模型内部与后训练连贯性耦合的“善恶向量”,这种结构性的修改很可能泛化到其他上下文。

所属事件:将模型视为偏好集合,RL 拉伸倾向(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →