Deep Persona: A Psychologically Grounded Architecture and Evaluation Framework for Role-Playing Agents and Simulations
Rotem Dror, Zohar Elyoseph, Yuval Haber, Elad Refoua, Oshrat Ayalon, Adir Solomon
cs.CL, cs.AI
2026-09-06
海法大学把角色拆成外显、潜伏信念和不可说的核心动机三层,再用ADOS风格指标对照人类对话。两个Gemini临床模拟在合并基线上DNS达0.92与0.85,高于评过的普通LLM对话集。
给大模型套一段人设,短对话还能像样。拉长到几十轮,角色就开始漂:语气变了、记了不该记的事、或者突然跳出来说自己是 AI。心理咨询训练、软技能演练最怕这个,学员要的是按剧本反应、又不会破功的模拟对象。
现有做法多半是扁平提示,年龄、性格、职业列几条。它管得了下一句口吻,管不住这个人为什么会回避某个话题。海法大学和巴伊兰大学把问题拆成两半:怎么把人设写成可执行的内部结构,以及怎么不靠人工打分衡量「像不像人」。
Deep Persona 把大模型当成按剧本演戏的随机引擎,不指望它自己长出稳定人格。两条硬原则:没写进提示的行为迟早会漂,称为 scripted determinism;角色必须是反应式、边界清楚的,别让它去当需要主动带节奏的治疗师,称为 bounded agency。
人格分三层写进提示:
另有控制模块管阶段切换(防备、配合、反思),以及可选的具身模块,用方括号写动作。人设来自领域专家访谈,不是模型自己编。平台侧落在 Cesura.ai 的仿真环境里。
评估改编了临床里的 ADOS 观察维度,做成无参考指标:语用流畅(是否鹦鹉学舌、自我循环)、联合注意(用户抛出新实体下一句有没有接住)、情感一致性(话和括号动作是否对得上)、情绪多样性。四个分数组成向量,跟人类对话分布算马氏距离,再压成 Dialogue Naturalness Score(DNS)。另有三类压力测试:假记忆、出戏请求、攻击性用语。
人类基线来自 DailyDialog 的日常短对话,以及 CounselChat 的专家回复。LLM 侧包括 Role-Play(ChatGPT-3.5)、ABC-Eval,以及 CounselChat 上 Mistral 7B 的回复。
| 数据 | 语用 | 联合注意 | 情绪 |
| DailyDialog 人类 | 0.940 | 0.352 | 0.115 |
| CounselChat 人类 | 0.968 | 0.885 | 1.426 |
| ABC-Eval | 0.893 | 0.459 | 0.111 |
| CounselChat LLM | 0.968 | 0.934 | 2.205 |
| Sarah(Deep Persona) | 0.940 | 0.520 | 0.492 |
| Evelyn | 0.927 | 0.308 | 0.066 |
LLM 语用普遍在 0.88–0.97,流畅没问题。缺口在情绪校准:开放域对话情绪偏低,CounselChat 的 LLM 回复又偏高(2.205,人类专家是 1.426)。对照 DailyDialog,Role-Play 和 ABC-Eval 的 DNS 大约 0.66–0.82;换到 CounselChat 人类基线,这些集合几乎全部掉到 0.05–0.06。
两个 Gemini 2.5 Pro 临床模拟:Sarah 是 49 轮希伯来语风险评估会话,Evelyn 是 16 段家长心智化训练(平均 13 轮)。合并人类基线上 DNS 分别是 0.918 和 0.850,全部对话在 p>0.05 下与人类不可区分,高于评过的所有 human–LLM 集合。Sarah 84% 的轮次带非语言提示,情感一致性 0.52;Evelyn 每轮都有动作,一致性 0.35。压力测试里角色没有交出菜谱、也没有改口自称 AI。
这是一份给角色扮演系统的工程说明书,不是新模型。做咨询训练、客服演练、组织软技能仿真时,扁平人设大概率撑不过压力测试。把「不能说的动机」写成硬约束,比反复加「请保持人设」管用。
评估框架可以单独拿去审现有 chatbot。DNS 对基线选择很敏感:日常闲聊里像样的模型,一放到高情绪专业对话上就会穿帮。
作者自己写得很清楚。两个案例是概念验证:Sarah 只有一场,对手是持证心理医生;Evelyn 的对话者是角色开发者本人,不是天真用户。两边都没有扁平提示对照,所以 DNS 高,还不能直接归因到三层架构。人类数据没有非语言通道,DNS 没把情感一致性算进去。当前指标把「话和动作不一致」当坏事,但临床人设有时就是要口不对心,框架会错罚这种设计。情绪词表和分类器跨语言是否稳,论文也没验证。