反驳 Persona 仅为行为论:RL 改变人格的机制

voooooogel · x · 2026-08-31

反驳 Persona 仅由响应定义的观点,指出模型具有元认知访问。举例:修改最后几层随机插入 meow 导致 ICL 扮演猫,并不算触及核心人格(如 assistant axis)。探讨 RL 是否真正诱导人格,或者只是修改了晚层电路(如插入拒绝后缀),进而影响对齐;质疑不同 Persona 提示可能通过完全不同机制起作用。

所属事件:模型人格之争 RL 能否重塑 AI 的核心倾向(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →