模型 Persona 仅是 ICL 适配?RL 是否改变人格?

lu_sichu · x · 2026-08-31

讨论 AI 模型中 Persona(人格)的定义与机制。作者反驳仅凭表层行为修改(如随机插入 meow 触发 ICL 猫娘扮演)即可定义为人格,认为未触及核心(如 assistant axis)。探讨 RLHF 是否真正诱导了人格,或是修改了晚层电路以改变对齐行为,以及不同 Persona 提示可能通过完全不同的机制(ICL 适配 vs 轴向操纵)起作用。

所属事件:模型人格之争 RL 能否重塑 AI 的核心倾向(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →