如何看待模型:偏好、倾向与 RL 的拉伸作用
voooooogel · x · 2026-08-31
作者对“假性利他主义”(PSM) 提出了不同的看法,认为很难定义“人设”,且该概念低估了后训练的能力。他主张将模型视为从 Token 级别到长文本叙事级别的“倾向、怪癖和偏好”的集合体,而强化学习 (RL) 则是对这个集合体进行推拉和拉伸。例如,RL 若想在特定上下文中使模型“失对齐”,最直接的方法可能是直接编辑模型内部与后训练连贯性耦合的“善恶向量”,这种结构性的修改很可能泛化到其他上下文。
所属事件:将模型视为偏好集合,RL 拉伸倾向(2 条相关)→
「研究」频道最新
- ITER 检索器:利用历史交互优化 Agent 深度研究 — _reachsumit · 2026-08-31
- 快手 HubMixer:用潜在 Hub 高效混合推荐特征 — _reachsumit · 2026-08-31
- DeepORG 基准测试:Gemini 3.7 Flash 以 97.3 分通过 113 项任务 — dosco · 2026-08-31
- 整理编程语言与机器学习 YouTube 学习歌单 — Aiden_Tech_Ai · 2026-08-31
- 盘点 30 个涵盖编程 AI 设计的免费学习网站 — Aiden_Tech_Ai · 2026-08-31
- 研究指出长时智能体安全无法由短时轨迹保证 — rohanpaul_ai · 2026-08-31