人格化 Agent 经历人生大事会变吗?会变,但变的是均值不是形状

Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events

Ming Wang, Peidong Wang, Xiaocui Yang, Daling Wang, Shi Feng, Fiona Fui-Hoon Nah, Ee-Peng Lim

cs.CL, cs.AI, cs.SI

2026-08-07

让 14 个大模型扮演 100 个人设经历 11 件人生大事,测 Big Five 性格变化:模型确实会动,但方向常错、幅度只有人类的约十分之一,且所有人设被压成同一条轨迹。

这篇在解决什么

越来越多的应用(情感陪伴、社交模拟、角色扮演)需要人格化的 LLM Agent(PC-Agent)在长期交互里保持连贯。一个关键问题是:经历人生大事后,它的性格该不该像人一样变化?人类心理学有大量纵向证据:入职升职后尽责性(Conscientiousness)上升,慢性病和失业后神经质(Neuroticism)上升,退休后尽责性下降。一个无视这些动态的 Agent,短期看着一致,长期会变成「顶个人名的静态脚本」。此前工作证明 LLM 性格能被扰动而变化,但变化在哪些特质、哪些事件、哪些模型上系统到什么程度,方向和幅度像不像人,基本没人查过。

方法

作者选了 11 件人生大事(入职、升职、失业、退休、结婚、离婚、生子、慢性病等),用 2 性别乘 5 文化区乘 10 性格类型的因子设计造了 100 个人口学可控的人设。每个人设先做一次标准 Big Five 量表(BFI-44),经历一段结构化的事件反思,再做一次同样的量表,差值就是性格变化。整套跑过 11 个模型,约 1.2 万条事件条件轨迹。还配了一套验证:无事件重测、独立改写事件、情境选择题、无关对话后的延迟重测,确认测到的是真信号。

分析围绕四条轴:变化是否存在、方向和幅度是否对得上人类、是否随性别和文化分化、同一事件下不同人设是否各有差异。并据此造了基准 BFI-Adapt,给事件诱发的性格变化是否贴合人类方向打分,排了 14 个模型。

结果

四条轴的结论一致:模型会动,但动得既不准也单调。

方向上,在有明确人类方向预期的 27 个事件与特质对里,只有约 56% 跟人类方向一致。退休是个全员翻车点:人类退休后尽责性下降,所有模型都预测成上升,正确率中位数仅 11.5%。入职升职这类职业事件对得最齐(毕业 42% 至 76%、入职 49% 至 96%)。宜人性(Agreeableness)是最弱的维度,模型倾向于「经历大事后变得更好说话」,哪怕人类证据相反。

现象结果
方向命中率(27 对)约 56%(余下近半反向)
退休与尽责性全模型反向,正确率中位 11.5%
变化幅度落进人类区间仅 11.0% 至 16.4%
人设间标准差 σ中位 0.19(人类 0.5 至 0.8)

幅度上更糟。把变化投影到人类方向后,只有 11.0% 至 16.4% 落进人类的效应量区间(约 0.035 至 0.14 个 Likert 单位),中位绝对变化约 0.02,比人类小约十倍;剩下要么反向,要么方向对但幅度不够,要么过冲。校准最好的 Gemini-3-flash 也只有 16.4% 落在区间内。

形状上两条都塌了。性别和文化区几乎不起调节作用(确定性方向组合里没有一个性别或洲际比较通过多重检验校正);个体层面,人设间的变化标准差中位只有 0.19,而人类样本是 0.5 至 0.8,被压扁了三四倍。换句话说,不同人设经历同一件事,模型给的是几乎同一条轨迹。BFI-Adapt 排名:Gemini-3-flash(0.348)、GLM-4.6(0.322)、Qwen3-235B(0.287)居前,全场跨 7.9 倍。

为什么重要

这是把「LLM 性格会不会像人一样发展」从感觉变成可量化诊断的工作。结论很清醒:现在的 PC-Agent 模拟的是人类性格变化的均值,不是它的形状,动一下、但方向含糊、幅度系统性偏小、个体差异被抹平。对做陪伴型 Agent 和社交模拟的人,这意味着长期连贯的人格演化还做不到,得在训练或架构层面补上事件特异性与个体异质性,光靠提示词撑不出真实的人格成长曲线。

局限与存疑

前后测设计只抓事件后的即时反应,够不到人类纵向研究里那种「急性期到适应」的多年轨迹;作者自己加了三轮无关对话后的延迟重测,但仍远短于人类面板的周期。人类方向先验表直接取自单一来源(Specht 2017),人类的 σ 和效应量区间本身是粗糙的元分析范围,把模型往这些粗区间上比,结论的精度有上限。BFI 是自陈量表,模型的自陈和它的实际行为选择只在少数模型上弱收敛(情境决策相关 ρ=0.003 至 0.105);「测到的变化」和「做出来的选择」未必是一回事。

术语

原文与代码

相关论文

全部论文解读