三层人格脚本约束角色扮演,临床模拟DNS超过普通LLM

Deep Persona: A Psychologically Grounded Architecture and Evaluation Framework for Role-Playing Agents and Simulations

Rotem Dror, Zohar Elyoseph, Yuval Haber, Elad Refoua, Oshrat Ayalon, Adir Solomon

cs.CL, cs.AI

2026-09-06

海法大学把角色拆成外显、潜伏信念和不可说的核心动机三层,再用ADOS风格指标对照人类对话。两个Gemini临床模拟在合并基线上DNS达0.92与0.85,高于评过的普通LLM对话集。

这篇在解决什么

给大模型套一段人设,短对话还能像样。拉长到几十轮,角色就开始漂:语气变了、记了不该记的事、或者突然跳出来说自己是 AI。心理咨询训练、软技能演练最怕这个,学员要的是按剧本反应、又不会破功的模拟对象。

现有做法多半是扁平提示,年龄、性格、职业列几条。它管得了下一句口吻,管不住这个人为什么会回避某个话题。海法大学和巴伊兰大学把问题拆成两半:怎么把人设写成可执行的内部结构,以及怎么不靠人工打分衡量「像不像人」。

方法

Deep Persona 把大模型当成按剧本演戏的随机引擎,不指望它自己长出稳定人格。两条硬原则:没写进提示的行为迟早会漂,称为 scripted determinism;角色必须是反应式、边界清楚的,别让它去当需要主动带节奏的治疗师,称为 bounded agency。

人格分三层写进提示:

另有控制模块管阶段切换(防备、配合、反思),以及可选的具身模块,用方括号写动作。人设来自领域专家访谈,不是模型自己编。平台侧落在 Cesura.ai 的仿真环境里。

评估改编了临床里的 ADOS 观察维度,做成无参考指标:语用流畅(是否鹦鹉学舌、自我循环)、联合注意(用户抛出新实体下一句有没有接住)、情感一致性(话和括号动作是否对得上)、情绪多样性。四个分数组成向量,跟人类对话分布算马氏距离,再压成 Dialogue Naturalness Score(DNS)。另有三类压力测试:假记忆、出戏请求、攻击性用语。

结果

人类基线来自 DailyDialog 的日常短对话,以及 CounselChat 的专家回复。LLM 侧包括 Role-Play(ChatGPT-3.5)、ABC-Eval,以及 CounselChat 上 Mistral 7B 的回复。

数据语用联合注意情绪
DailyDialog 人类0.9400.3520.115
CounselChat 人类0.9680.8851.426
ABC-Eval0.8930.4590.111
CounselChat LLM0.9680.9342.205
Sarah(Deep Persona)0.9400.5200.492
Evelyn0.9270.3080.066

LLM 语用普遍在 0.88–0.97,流畅没问题。缺口在情绪校准:开放域对话情绪偏低,CounselChat 的 LLM 回复又偏高(2.205,人类专家是 1.426)。对照 DailyDialog,Role-Play 和 ABC-Eval 的 DNS 大约 0.66–0.82;换到 CounselChat 人类基线,这些集合几乎全部掉到 0.05–0.06。

两个 Gemini 2.5 Pro 临床模拟:Sarah 是 49 轮希伯来语风险评估会话,Evelyn 是 16 段家长心智化训练(平均 13 轮)。合并人类基线上 DNS 分别是 0.918 和 0.850,全部对话在 p>0.05 下与人类不可区分,高于评过的所有 human–LLM 集合。Sarah 84% 的轮次带非语言提示,情感一致性 0.52;Evelyn 每轮都有动作,一致性 0.35。压力测试里角色没有交出菜谱、也没有改口自称 AI。

为什么重要

这是一份给角色扮演系统的工程说明书,不是新模型。做咨询训练、客服演练、组织软技能仿真时,扁平人设大概率撑不过压力测试。把「不能说的动机」写成硬约束,比反复加「请保持人设」管用。

评估框架可以单独拿去审现有 chatbot。DNS 对基线选择很敏感:日常闲聊里像样的模型,一放到高情绪专业对话上就会穿帮。

局限与存疑

作者自己写得很清楚。两个案例是概念验证:Sarah 只有一场,对手是持证心理医生;Evelyn 的对话者是角色开发者本人,不是天真用户。两边都没有扁平提示对照,所以 DNS 高,还不能直接归因到三层架构。人类数据没有非语言通道,DNS 没把情感一致性算进去。当前指标把「话和动作不一致」当坏事,但临床人设有时就是要口不对心,框架会错罚这种设计。情绪词表和分类器跨语言是否稳,论文也没验证。

术语

原文与代码

相关论文

全部论文解读