探讨模型后训练:Persona 概念被低估,RL 重塑倾向

voooooogel · x · 2026-08-31

讨论指出 Persona (PSM) 概念模糊且低估了后训练潜力。更好的视角是将模型视为从 token 到上下文层面的倾向、癖好和偏好的集合,而强化学习 (RL) 则是对这一集合的推拉和重塑。

所属事件:模型人格之争 RL 能否重塑 AI 的核心倾向(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →